Игорь Градов
Игорь Градов
5 мин
ai

Стоимость API нейросетей обманчива: дешёвая модель обошлась дороже за каждую решённую задачу

Стоимость API нейросетей обманчива: в апреле 2026 года FinTech-команда перешла на дешёвую модель, чтобы сэкономить, и обнаружила, что каждая решённая задача стала обходиться дороже, чем на прежней дорогой.

Стоимость API нейросетей обманчива: дешёвая модель обошлась дороже за каждую решённую задачу
Почему это важно

Прайс-лист на токены (единицы текста, которые модель читает и генерирует) перестал быть ориентиром. Разница между верхней и нижней строчкой таблицы превышает тридцать раз по входу и сто раз по выходу, но реальный счёт зависит от скрытых множителей, которых в прайсе нет.

Историю разобрал Сергей Прощаев, Tech Lead направления Java/Kotlin в FinTech и преподаватель курсов разработки и архитектуры в ОТУС. В апреле его команда подключила ИИ-агента (программу, которая сама выполняет цепочку действий без участия человека) к рутинной задаче: разбору упавших интеграционных тестов. Взяли лучшую модель, получили счёт, годовая проекция которого перекрывала зарплату ещё одного разработчика. Перешли на модель подешевле. Счёт упал примерно на треть, а доля задач, которые агент доводил до зелёных тестов, упала сильнее. Каждая закрытая задача стала дороже.

Прайс за миллион токенов больше не ориентир?

За одну неделю июля 2025 года вышло семь заметных моделей от пяти вендоров. Перепробовать их руками невозможно, и вопрос «какая модель лучшая» распался на три отдельных вопроса: лучшая на доллар, лучшая на тип задачи, лучшая на бюджет токенов. Такую формулировку Прощаев приводит со ссылкой на разбор buildthisnow.com.

Стоимость API нейросетей в прайс-листах выглядит простой: умножил токены на ставку, получил сумму. Но агент это не один запрос. В бенчмарке (тестовом наборе задач) ProjDevBench, где шесть агентов строили проекты с нуля по двадцати задачам, среднее потребление составило 138 шагов и 4,81 миллиона токенов на задачу при доле принятых решений 27,38%, по данным препринта arXiv:2602.01655. И это среднее, а не медиана: зациклившийся агент утяжеляет хвост распределения.

Каждый шаг перечитывает всю накопленную историю. К десятому шагу вы оплачиваете первый файл в десятый раз.

Аргументы за дешёвую модель

  • Входной порог ниже. Разница в ставке за миллион токенов превышает тридцать раз на входе. Для простых задач без длинных цепочек это реальная экономия.
  • Быстрые эксперименты. Пока вы тестируете гипотезу и не знаете, полетит ли агент вообще, дешёвая модель позволяет набрать статистику без болезненного счёта.
  • Кэширование снижает разрыв. Провайдеры тарифицируют повторно отправленный префикс (начало запроса, которое уже было отправлено ранее) дешевле: у Anthropic и новых моделей OpenAI чтение из кэша стоит около 10% обычной входной ставки, у Google на неявном кэшировании порядка 75%. Если задача устроена так, что большая часть контекста повторяется, стоимость API нейросетей на практике оказывается заметно ниже номинальной.

Три скрытых ловушки, которые делают «дешёвое» дорогим

Ловушка первая: вы считаете токены не в том месте. Прощаев описал расхождение между собственным расчётом и биллингом ровно вдвое. Причина: он суммировал поле usage по финальному ответу агента, а платить приходится за каждый промежуточный шаг. Агент прочитал файл, это запрос. Запустил тесты, получил лог, ещё запрос, и в него уехала вся предыдущая история.

Ловушка вторая: скидка на кэш не распространяется на выход. Выходные токены (то, что модель генерирует) не дешевеют ни у одного провайдера. Любая оценка экономии, которая распространяет кэш-дисконт на генерацию, завышена. А у рассуждающих моделей (reasoning model, модели, которые «думают» перед ответом) доля выходных токенов непропорционально велика.

Ловушка третья: дешёвая модель решает меньше задач. Когда доля успешных прогонов падает, стоимость одной решённой задачи растёт, даже если ставка за миллион токенов в разы ниже. Именно это произошло в команде Прощаева: счёт упал на треть, а количество закрытых задач упало сильнее, и стоимость результата выросла.

Я сделал то, что казалось очевидным: перешёл на модель подешевле. Счёт упал примерно на треть, а количество задач, которые агент доводил до зелёных тестов, упало сильнее — и каждая закрытая задача стала обходиться дороже, чем была. : Сергей Прощаев, Tech Lead, FinTech, преподаватель ОТУС

Что считать вместо «цены за миллион»?

Прощаев предлагает считать не токены, а стоимость решённой задачи. Для этого нужны три вещи:

  • Суммировать usage по каждому шагу агента, а не по финальному ответу. Входные токены, кэшированные входные токены и выходные токены суммируются отдельно.
  • Выделять кэшированные токены отдельной строкой. У разных провайдеров поля устроены по-разному: у одних кэшированные токены входят в общий счётчик, у других лежат отдельным полем. Если не привести к единой семантике на границе с API, получите либо двойной учёт, либо отрицательное значение.
  • Привязывать расход к результату. Не «сколько потратили за месяц», а «сколько стоила одна задача, доведённая до зелёных тестов». Без этого невозможно сравнить две модели честно.

Что с этого прямо сейчас?

Автору Дзена и копирайтеру. Если вы используете API для генерации контента и платите за токены, проверьте, как считается ваш расход. Длинный системный промпт (инструкция, которую вы отправляете модели перед каждым запросом), отправляемый повторно, может кэшироваться со скидкой до 90%, но только на входе. Генерация текста на выходе всегда по полной ставке.

Маркетологу. Когда вам приносят смету на ИИ-агента, спрашивайте не «какая модель», а «сколько стоит одна решённая задача». Ставка за миллион токенов ничего не говорит о реальном счёте без данных о количестве шагов и доле успешных прогонов.

Предпринимателю в РФ. Из доступных в России провайдеров YandexGPT и GigaChat имеют собственные тарифные сетки, но логика скрытых расходов та же: агент перечитывает контекст на каждом шаге. Перед масштабированием любого агентного решения заложите пилот с подсчётом стоимости результата, а не стоимости токена.

Мнение редакции dzen.guru

Разбор Прощаева ценен тем, что это не теория, а реальный биллинг реальной команды. По моим наблюдениям, большинство тех, кто подключает API впервые, считают ровно так же: умножают токены на прайс и удивляются счёту. Позиция dzen.guru: стоимость API нейросетей нужно считать от результата, а не от прайс-листа. Дешёвая модель, которая решает вдвое меньше задач, обходится дороже дорогой. Оговорка: конкретные цифры экономии на кэшировании зависят от провайдера и меняются быстро, проверяйте прайс-страницу перед каждым расчётом.

Тем, кто сейчас выбирает модель для агентного сценария, стоит начать не с таблицы тарифов, а с пилота на десяти задачах, замерив стоимость одной закрытой. Прайсы продолжат падать, конкуренция между провайдерами этому способствует, но структура расходов агента, где каждый шаг перечитывает историю, никуда не денется. Именно она определяет счёт, а не число в колонке «за миллион токенов».

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Vercel бесплатно покажет, что такое ИИ-агент видит на вашем сайте: 118 проверок за минуту
ai

Vercel бесплатно покажет, что такое ИИ-агент видит на вашем сайте: 118 проверок за минуту

Vercel 3 июня открыла бесплатный сервис Is Agentic, который за минуту показывает, насколько ваш сайт готов к тому, чтобы ИИ-агенты могли его найти, прочитать и…

5 мин
Нейросеть для обработки документов deepdoctection: конвейер из открытых моделей без платных API
ai

Нейросеть для обработки документов deepdoctection: конвейер из открытых моделей без платных API

Библиотека deepdoctection версии 1.2.x собирает в один конвейер распознавание структуры страницы, таблиц, текста и порядка чтения, и в этом руководстве мы…

6 мин
ЕЦБ предупредил: ИИ пузырь на рынке США ударит по пенсионным фондам всего мира
ai

ЕЦБ предупредил: ИИ пузырь на рынке США ударит по пенсионным фондам всего мира

Пятого июня 2025 года Европейский центральный банк опубликовал доклад, в котором сравнил нынешний бум акций ИИ-компаний с пузырём доткомов 1990-х и…

5 мин