Игорь Градов
Игорь Градов
6 мин
ai

Radeon для инференса нейросетей: 97% нагрузки, не TFLOPS, решает кэш префиксов

Реальные замеры на работающем стенде за неделю и 11 426 запросов показали, что агентские нагрузки на локальную языковую модель на 97% состоят из чтения кэшированного контекста, а генерация нового текста занимает доли процента трафика.

Radeon для инференса нейросетей: 97% нагрузки, не TFLOPS, решает кэш префиксов
Почему это важно

Большинство публичных бенчмарков измеряют скорость генерации (токенов в секунду на выходе), но на реальных агентских задачах эта метрика описывает 0,2% трафика. Кто выбирает железо или облако по таким тестам, оптимизирует не то, что тратит деньги и время.

Исследование опубликовано как практический разбор пяти последовательных конфигураций локального стенда для инференса (выполнения запросов к нейросети без отправки данных в облако). Автор прошёл путь от модели Qwen3 30B до Qwen3-Coder-Next 80B с архитектурой MoE (Mixture of Experts, когда при каждом запросе работает не вся модель, а только нужная часть «экспертов»), подключил шлюз LiteLLM для подсчёта токенов и в итоге обнаружил, что без правильно настроенного кэша префиксов стенд работал в тридцать раз медленнее, чем мог.

Показатель Значение Источник
Доля кэшированного чтения (по шлюзу) 96,9% Биллинг LiteLLM за календарную неделю
Доля кэшированного чтения (по движку) 97,3% (1 345 481 136 попаданий из 1 383 053 896 запрошенных токенов) Счётчики vLLM за период аптайма
Среднее число входных токенов на запрос 123 700, из них 119 800 из кэша, 3 900 обработано Биллинг шлюза, 11 426 запросов
Среднее число сгенерированных токенов на запрос 274 Биллинг шлюза
Соотношение вход/выход 452:1 Расчёт по данным шлюза
Обработано запросов за период 11 426 Данные шлюза
Активных пользователей 16 Данные стенда
Запросов на человека в неделю около 500 (примерно 100 за рабочий день) Расчёт по данным шлюза
Стоимость аренды стенда 131 000 рублей в месяц (не зависит от числа пользователей) Данные автора

Что измеряли?

Автор собрал рабочий стенд для локального инференса нейросетей и прогнал через него реальные агентские задачи. ИИ-агент (программа, которая сама решает, какие шаги предпринять для выполнения задачи) при каждом обращении передаёт модели большой контекст: историю переписки, системный промпт, результаты предыдущих шагов. Модель читает этот контекст и выдаёт короткий ответ: следующее действие или фрагмент кода.

Ключевой вопрос: какая часть вычислений уходит на чтение уже знакомого контекста, а какая на генерацию нового текста? Для ответа использовали два независимых счётчика. Шлюз LiteLLM считал токены (минимальные единицы текста, которые обрабатывает модель) на входе и выходе. Движок vLLM вёл собственную статистику попаданий в кэш.

Всего за неделю через стенд прошли 11 426 запросов от 16 пользователей. Это не синтетический тест, а обычная рабочая нагрузка.

Пять конфигураций и главный урок

Путь к рабочему стенду занял пять итераций, и каждая вскрывала проблему, невидимую на предыдущем шаге:

  • Qwen3 30B (dense, без MoE): кэш работал сразу, стенд вёл себя стабильно. Но модель не справлялась с агентскими задачами и требовала ручных подталкиваний. Быстро, но бесполезно.
  • Qwen3-Coder-Next 30B (MoE): качество выросло, но 30-миллиардная модель на карте с 96 ГБ памяти занимала лишь четверть ресурсов. Авторы сравнили это с «малолитражкой в грузовике».
  • Qwen3-Coder-Next 80B (MoE): качество стало приемлемым, переход занял вечер. Но кэш для гибридной архитектуры в используемой сборке vLLM не работал, а команда этого не знала и видела только «иногда медленно».
  • Подключение LiteLLM: шлюз дал разбивку по типам токенов, и стало видно, что запросы читают на порядки больше, чем генерируют. До этого была одна общая цифра «токенов потрачено», из которой ничего не следовало.
  • vLLM с явным флагом кэша: параметр --enable-prefix-caching для гибридных моделей не включается автоматически, его нужно указывать вручную. До версии 0.27.1 он для этой связки не работал вовсе.

Результат подтвердился с двух сторон: шлюз показал 96,9% чтения из кэша, движок показал 97,3%. Цифры сходятся, значит, оба инструмента измеряли одно и то же.

Соотношение 452:1 переворачивает привычную экономику

Средний шаг агента тащит 123 700 входных токенов и выдаёт 274. Для Radeon и любого другого железа для инференса нейросетей TFLOPS на генерацию описывают доли процента реальной нагрузки. Это не теоретический расчёт, а факт из рабочего трафика.

Автор приводит два практических следствия. На агентской нагрузке оптимизация чтения контекста важнее скорости генерации. И сравнивать локальный стенд с облаком нужно по фактическому биллингу с учётом кэша, а не по сырому объёму входных токенов.

Без кэширования счёт вырастает примерно в семь раз. Это верно и для облака: кэшированный вход там стоит 10% от обычного входного тарифа. Но механизмы разные. Локальный prefix caching включается флагом и работает на всём подряд. В облаке кэш объявляется явными точками разрыва, имеет время жизни (TTL) и отдельную цену записи, поэтому 96,9% попаданий на облако не переносятся напрямую.

Для пользователей из РФ добавляется ещё один слой: прямой биллинг у крупных провайдеров недоступен, наценку реселлера нужно закладывать отдельной строкой. По расчёту автора, платёжный курс составляет 96 рублей за доллар (биржевой 88,36 плюс комиссия платёжных систем), и эта разница уже первая скрытая строка в счёте.

Как это читать

Все цифры сняты с одного стенда, одной модели (Qwen3-Coder-Next 80B MoE) и одного типа нагрузки (агентский кодинг). На других задачах, например на генерации длинных текстов, соотношение входа к выходу будет другим, и кэш даст меньший эффект. Кэш в 97% достижим именно потому, что агентские запросы раз за разом передают один и тот же длинный контекст с небольшими изменениями. Для задач с уникальным входом (каждый промпт новый) эта цифра нерелевантна. Тарифы облачных провайдеров автор проверял на 22 августа 2026 года и прямо предупреждает: к моменту окупаемости стенда расценки могут упасть не в вашу пользу.

Что это значит для вас?

Авторам Дзена и копирайтерам. Если вы используете ИИ-агентов для исследования тем, сбора фактов, проверки текстов, каждый ваш запрос тоже тащит длинный контекст. На подписочных тарифах это незаметно, пока не упираетесь в лимит пятичасового окна. Автор исследования прямо пишет, что подписка продаёт не токены, а доступ с двумя лимитами: недельным и скользящим пятичасовым. Если агент съедает лимит за два часа активной работы, подписка перестаёт быть выгодной.

Маркетологам и руководителям. Когда считаете, выгоднее ли держать модель на своём сервере или покупать облачный API, проверяйте: а учитывает ли ваш расчёт кэширование? Облачные калькуляторы часто считают по сырому объёму входа. Если ваши агентские нагрузки похожи на описанные (соотношение 452:1), разница между «сырым» и «кэшированным» счётом составляет семикратный множитель.

Предпринимателям в РФ. Стенд за 131 000 рублей в месяц обслуживает 16 пользователей и не зависит от курса доллара после оплаты аренды. Облачный вариант при текущем платёжном курсе 96 рублей за доллар и наценке реселлера может оказаться дороже. Из доступных в РФ моделей для локального развёртывания семейство Qwen работает с открытыми весами, GigaChat и YandexGPT доступны через API, но без локальной установки.

Мнение редакции dzen.guru

Я вижу в этом исследовании простую, но неудобную правду: индустрия продаёт инференс по метрикам генерации (TFLOPS, токены в секунду на выходе), а реальная агентская работа на 97% состоит из чтения. Это как выбирать грузовик по максимальной скорости, когда он 97% времени стоит под загрузкой. Для тех, кто выбирает карту Radeon для инференса нейросетей, TFLOPS генерации тоже не главный параметр: важнее пропускная способность памяти и поддержка prefix caching в вашем конкретном стеке. Мы в dzen.guru будем следить за продолжением: автор обещал отдельный разбор выбора модели по реальным замерам, а не по синтетическим бенчмаркам.

Один практический шаг, который можно сделать прямо сейчас: если у вас работает локальная модель на vLLM, проверьте, включён ли prefix caching для вашей конкретной архитектуры. Не «есть ли он в vLLM» (он есть), а работает ли он именно с вашей моделью в вашей версии. Строка cache read в статистике движка, это разница между «иногда медленно» и семикратной экономией.

По данным оригинального исследования

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Что такое ИИ-агент на практике: TrueForge даёт готовую среду выполнения в опенсорсе

Компания TrueFoundry открыла код TrueForge, среды выполнения для ИИ-агентов, которая берёт на себя управление состоянием, песочницу для кода и сжатие…

6 мин
ai

Google Play разыгрывает 20 000 призов за баллы, но скачать участие из России нельзя

Google Play запустил розыгрыш коллекционных вещей и VIP-поездок за баллы, но пока только для пользователей в США, и продлится акция до 14 сентября 2025 года.…

3 мин
Расследование a16z: Минюст США впервые применил закон 1914 года к венчурному фонду
ai

Расследование a16z: Минюст США впервые применил закон 1914 года к венчурному фонду

Почему это важно Минюст США впервые за долгие годы применил антимонопольный закон 1914 года к венчурному фонду, а не к корпорации: если практика закрепится,…

5 мин