Radeon для инференса нейросетей: 97% нагрузки, не TFLOPS, решает кэш префиксов
Реальные замеры на работающем стенде за неделю и 11 426 запросов показали, что агентские нагрузки на локальную языковую модель на 97% состоят из чтения кэшированного контекста, а генерация нового текста занимает доли процента трафика.

Большинство публичных бенчмарков измеряют скорость генерации (токенов в секунду на выходе), но на реальных агентских задачах эта метрика описывает 0,2% трафика. Кто выбирает железо или облако по таким тестам, оптимизирует не то, что тратит деньги и время.
Исследование опубликовано как практический разбор пяти последовательных конфигураций локального стенда для инференса (выполнения запросов к нейросети без отправки данных в облако). Автор прошёл путь от модели Qwen3 30B до Qwen3-Coder-Next 80B с архитектурой MoE (Mixture of Experts, когда при каждом запросе работает не вся модель, а только нужная часть «экспертов»), подключил шлюз LiteLLM для подсчёта токенов и в итоге обнаружил, что без правильно настроенного кэша префиксов стенд работал в тридцать раз медленнее, чем мог.
| Показатель | Значение | Источник |
|---|---|---|
| Доля кэшированного чтения (по шлюзу) | 96,9% | Биллинг LiteLLM за календарную неделю |
| Доля кэшированного чтения (по движку) | 97,3% (1 345 481 136 попаданий из 1 383 053 896 запрошенных токенов) | Счётчики vLLM за период аптайма |
| Среднее число входных токенов на запрос | 123 700, из них 119 800 из кэша, 3 900 обработано | Биллинг шлюза, 11 426 запросов |
| Среднее число сгенерированных токенов на запрос | 274 | Биллинг шлюза |
| Соотношение вход/выход | 452:1 | Расчёт по данным шлюза |
| Обработано запросов за период | 11 426 | Данные шлюза |
| Активных пользователей | 16 | Данные стенда |
| Запросов на человека в неделю | около 500 (примерно 100 за рабочий день) | Расчёт по данным шлюза |
| Стоимость аренды стенда | 131 000 рублей в месяц (не зависит от числа пользователей) | Данные автора |
Что измеряли?
Автор собрал рабочий стенд для локального инференса нейросетей и прогнал через него реальные агентские задачи. ИИ-агент (программа, которая сама решает, какие шаги предпринять для выполнения задачи) при каждом обращении передаёт модели большой контекст: историю переписки, системный промпт, результаты предыдущих шагов. Модель читает этот контекст и выдаёт короткий ответ: следующее действие или фрагмент кода.
Ключевой вопрос: какая часть вычислений уходит на чтение уже знакомого контекста, а какая на генерацию нового текста? Для ответа использовали два независимых счётчика. Шлюз LiteLLM считал токены (минимальные единицы текста, которые обрабатывает модель) на входе и выходе. Движок vLLM вёл собственную статистику попаданий в кэш.
Всего за неделю через стенд прошли 11 426 запросов от 16 пользователей. Это не синтетический тест, а обычная рабочая нагрузка.
Пять конфигураций и главный урок
Путь к рабочему стенду занял пять итераций, и каждая вскрывала проблему, невидимую на предыдущем шаге:
- Qwen3 30B (dense, без MoE): кэш работал сразу, стенд вёл себя стабильно. Но модель не справлялась с агентскими задачами и требовала ручных подталкиваний. Быстро, но бесполезно.
- Qwen3-Coder-Next 30B (MoE): качество выросло, но 30-миллиардная модель на карте с 96 ГБ памяти занимала лишь четверть ресурсов. Авторы сравнили это с «малолитражкой в грузовике».
- Qwen3-Coder-Next 80B (MoE): качество стало приемлемым, переход занял вечер. Но кэш для гибридной архитектуры в используемой сборке vLLM не работал, а команда этого не знала и видела только «иногда медленно».
- Подключение LiteLLM: шлюз дал разбивку по типам токенов, и стало видно, что запросы читают на порядки больше, чем генерируют. До этого была одна общая цифра «токенов потрачено», из которой ничего не следовало.
- vLLM с явным флагом кэша: параметр
--enable-prefix-cachingдля гибридных моделей не включается автоматически, его нужно указывать вручную. До версии 0.27.1 он для этой связки не работал вовсе.
Результат подтвердился с двух сторон: шлюз показал 96,9% чтения из кэша, движок показал 97,3%. Цифры сходятся, значит, оба инструмента измеряли одно и то же.
Соотношение 452:1 переворачивает привычную экономику
Средний шаг агента тащит 123 700 входных токенов и выдаёт 274. Для Radeon и любого другого железа для инференса нейросетей TFLOPS на генерацию описывают доли процента реальной нагрузки. Это не теоретический расчёт, а факт из рабочего трафика.
Автор приводит два практических следствия. На агентской нагрузке оптимизация чтения контекста важнее скорости генерации. И сравнивать локальный стенд с облаком нужно по фактическому биллингу с учётом кэша, а не по сырому объёму входных токенов.
Без кэширования счёт вырастает примерно в семь раз. Это верно и для облака: кэшированный вход там стоит 10% от обычного входного тарифа. Но механизмы разные. Локальный prefix caching включается флагом и работает на всём подряд. В облаке кэш объявляется явными точками разрыва, имеет время жизни (TTL) и отдельную цену записи, поэтому 96,9% попаданий на облако не переносятся напрямую.
Для пользователей из РФ добавляется ещё один слой: прямой биллинг у крупных провайдеров недоступен, наценку реселлера нужно закладывать отдельной строкой. По расчёту автора, платёжный курс составляет 96 рублей за доллар (биржевой 88,36 плюс комиссия платёжных систем), и эта разница уже первая скрытая строка в счёте.
Все цифры сняты с одного стенда, одной модели (Qwen3-Coder-Next 80B MoE) и одного типа нагрузки (агентский кодинг). На других задачах, например на генерации длинных текстов, соотношение входа к выходу будет другим, и кэш даст меньший эффект. Кэш в 97% достижим именно потому, что агентские запросы раз за разом передают один и тот же длинный контекст с небольшими изменениями. Для задач с уникальным входом (каждый промпт новый) эта цифра нерелевантна. Тарифы облачных провайдеров автор проверял на 22 августа 2026 года и прямо предупреждает: к моменту окупаемости стенда расценки могут упасть не в вашу пользу.
Что это значит для вас?
Авторам Дзена и копирайтерам. Если вы используете ИИ-агентов для исследования тем, сбора фактов, проверки текстов, каждый ваш запрос тоже тащит длинный контекст. На подписочных тарифах это незаметно, пока не упираетесь в лимит пятичасового окна. Автор исследования прямо пишет, что подписка продаёт не токены, а доступ с двумя лимитами: недельным и скользящим пятичасовым. Если агент съедает лимит за два часа активной работы, подписка перестаёт быть выгодной.
Маркетологам и руководителям. Когда считаете, выгоднее ли держать модель на своём сервере или покупать облачный API, проверяйте: а учитывает ли ваш расчёт кэширование? Облачные калькуляторы часто считают по сырому объёму входа. Если ваши агентские нагрузки похожи на описанные (соотношение 452:1), разница между «сырым» и «кэшированным» счётом составляет семикратный множитель.
Предпринимателям в РФ. Стенд за 131 000 рублей в месяц обслуживает 16 пользователей и не зависит от курса доллара после оплаты аренды. Облачный вариант при текущем платёжном курсе 96 рублей за доллар и наценке реселлера может оказаться дороже. Из доступных в РФ моделей для локального развёртывания семейство Qwen работает с открытыми весами, GigaChat и YandexGPT доступны через API, но без локальной установки.
Я вижу в этом исследовании простую, но неудобную правду: индустрия продаёт инференс по метрикам генерации (TFLOPS, токены в секунду на выходе), а реальная агентская работа на 97% состоит из чтения. Это как выбирать грузовик по максимальной скорости, когда он 97% времени стоит под загрузкой. Для тех, кто выбирает карту Radeon для инференса нейросетей, TFLOPS генерации тоже не главный параметр: важнее пропускная способность памяти и поддержка prefix caching в вашем конкретном стеке. Мы в dzen.guru будем следить за продолжением: автор обещал отдельный разбор выбора модели по реальным замерам, а не по синтетическим бенчмаркам.
Один практический шаг, который можно сделать прямо сейчас: если у вас работает локальная модель на vLLM, проверьте, включён ли prefix caching для вашей конкретной архитектуры. Не «есть ли он в vLLM» (он есть), а работает ли он именно с вашей моделью в вашей версии. Строка cache read в статистике движка, это разница между «иногда медленно» и семикратной экономией.
По данным оригинального исследования

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Что такое ИИ-агент на практике: TrueForge даёт готовую среду выполнения в опенсорсе
Компания TrueFoundry открыла код TrueForge, среды выполнения для ИИ-агентов, которая берёт на себя управление состоянием, песочницу для кода и сжатие…
Google Play разыгрывает 20 000 призов за баллы, но скачать участие из России нельзя
Google Play запустил розыгрыш коллекционных вещей и VIP-поездок за баллы, но пока только для пользователей в США, и продлится акция до 14 сентября 2025 года.…

Расследование a16z: Минюст США впервые применил закон 1914 года к венчурному фонду
Почему это важно Минюст США впервые за долгие годы применил антимонопольный закон 1914 года к венчурному фонду, а не к корпорации: если практика закрепится,…
Комментарии