Игорь Градов
Игорь Градов
7 мин
ai

Как мультимодальность влияет на развитие ИИ-агентов: кэш съедает 82% токенов, а разрыв в цене достигает 90 раз

Почему это важно 82% токенов в типичной сессии с ИИ-агентом приходится на кэш, повторную отправку уже знакомого контекста. Разница между оптимизированным и…

Почему это важно

82% токенов в типичной сессии с ИИ-агентом приходится на кэш, повторную отправку уже знакомого контекста. Разница между оптимизированным и неоптимизированным использованием одной и той же модели достигает нескольких тысяч долларов в месяц, а между самой дорогой и самой дешёвой моделью при одинаковой нагрузке разрыв почти в 90 раз.

Автор оригинального исследования в августе 2026 года показал коллегам таблицу с месячной стоимостью работы через разные модели, а через месяц половина цифр устарела: DeepSeek ввёл пиковые тарифы, Z.ai перевёл GLM Coding Plan на кредиты, появились новые модели.

Пришлось пересчитать всё заново по ценам на 16 сентября 2026 года. Результат раскрывает механику, которую легко упустить: стоимость работы с ИИ-агентом определяет не то, что вы печатаете, а то, что агентная обвязка (харнес, программа-обёртка вроде Claude Code или Cursor, которая управляет диалогом с моделью) отправляет за вас.

Что Когда Кто опубликовал Цена
Пересчёт стоимости API и подписок для ИИ-агентов 16 сентября 2026 (дата цен) Автор независимого исследования От $87 до $7 720 в месяц при одинаковой нагрузке

Кэш решает больше, чем выбор модели

Исследование построено на типичном месяце работы с агентом: 492 миллиона новых входных токенов (токен, это минимальная единица текста для модели, примерно три четверти слова), 2,3 миллиарда токенов из кэша, 10 миллионов выходных и около 25 тысяч запросов.

Средний запрос весит около 112 тысяч токенов. Почти весь этот объём уже отправлялся раньше: системный промпт, описания инструментов, история диалога. Модель ничего не помнит между вызовами, поэтому харнес каждый раз пересылает ей всё заново.

Провайдеры дают скидку на повторное чтение одного и того же начала промпта:

  • У моделей Anthropic чтение кэша стоит 0,1 от цены входа, а у Fable 5.1 ещё дешевле: 0,025
  • У OpenAI скидка на кэшированные токены достигает 90%, по данным документации OpenAI
  • Запись в кэш тарифицируется отдельно: для Opus 5 при стандартном пятиминутном TTL (время жизни кэша) это дополнительные $615, при часовом TTL уже $2 460

Без кэша тот же месяц на Opus 5 стоил бы не $3 860, а примерно $14 000, по расчётам автора исследования.

Что именно изменилось в ценах к сентябрю 2026?

  • Anthropic выпустила Fable 5.1 с кэшем в четыре раза дешевле, чем у Fable 5. Цены Opus 5 не менялись
  • OpenAI снизила цену GPT-5.6 Sol до $4 за вход и $20 за выход (промоакция как минимум до 21 ноября) и выпустила GPT-6 Astra. В линейке 5.6 Sol самая большая модель, Terra средняя, Luna самая маленькая
  • DeepSeek в августе ввёл пиковые тарифы: по будням с 04:00 до 07:00 и с 09:00 до 13:00 по Москве всё стоит вдвое дороже. 10 сентября вышел DeepSeek V4.1 Flash, он дешевле прежнего V4 Flash
  • Kimi K3 по API обходится почти как Sol
  • Z.ai GLM-5.3 по API стоит столько же, сколько GLM-5.2

Разница между Astra и DeepSeek V4.1 Flash вне пика составляет почти 90 раз: $7 720 против $87.

Почему дорогой промпт иногда дешевле короткого?

Кэш работает по совпадающему началу. Если вы изменили что-то в начале промпта, всё, что идёт дальше, снова стоит полную цену. Большой, но стабильный промпт оказывается дешевле маленького, который постоянно меняется.

Автор проверил на Claude Code: только что запущенная сессия занимает около 45 тысяч токенов ещё до первого слова пользователя. На одно слово «привет» уходит ещё 18 тысяч. На собственной статистике Claude Code у автора 98% всех токенов приходится на чтение из кэша.

Вот правила, которые реально экономят деньги:

  1. Не меняйте начало промпта посреди сессии. Не переподключайте MCP-серверы (внешние инструменты, к которым агент обращается по ходу работы) и не правьте правила из системного промпта: у Anthropic изменение описаний инструментов инвалидирует кэш целиком
  2. Подключайте MCP-серверы и навыки на уровне проекта, а не глобально: их описания попадают в каждый вызов
  3. Следите за TTL. У Anthropic API стандартный TTL составляет пять минут, расширенный час. У GPT-5.6 и более новых моделей OpenAI минимальный TTL 30 минут
  4. Не режьте стабильную часть промпта вслепую: агенту не хватит контекста, он начнёт читать файлы и вызывать инструменты, и итоговый счёт за сессию вырастет

Подписки: не всё так выгодно, как кажется?

OpenCode Go стоит $10 в месяц, скидки на первый месяц больше нет. Лимиты заданы в долларах, а число запросов на странице подписки это только оценка на запросах определённого размера.

Тяжёлые запросы с сотнями тысяч токенов кэша съедают лимит быстрее. Но даже с пересчётом через доллары Go даёт в полтора и до шести раз больше, чем стоит. Это мультимодальность (способность модели работать с текстом, кодом и другими форматами одновременно) влияет на развитие ИИ-агентов не только технически, но и экономически: чем больше типов контента обрабатывает агент за вызов, тем важнее понимать реальную стоимость каждого токена.

Как попробовать оптимизацию кэша самому?

  1. Откройте статистику расхода токенов в инструменте, который вы используете (Claude Code, Cursor, OpenCode). Посмотрите, какая доля приходится на кэш
  2. Зафиксируйте системный промпт и описания инструментов в начале сессии. Не меняйте их в процессе работы
  3. Сравните стоимость по API с подпиской: при тяжёлых запросах подписка часто выгоднее, но считайте через доллары, а не через число запросов

Сравнение с российскими сервисами

YandexGPT и GigaChat на момент публикации не раскрывают отдельные тарифы на кэшированные токены. Механика кэширования промпта (prompt caching), которая у Anthropic и OpenAI удешевляет повторные вызовы в 10 и до 40 раз, в российских API публично не описана.

Для авторов из РФ и СНГ это означает: при работе с российскими моделями оптимизация пока сводится к сокращению промпта и числа вызовов, а не к управлению кэшем. Если ваш сценарий предполагает тысячи обращений в месяц, имеет смысл запросить у провайдера детали тарификации повторных токенов.

Что делать с этим прямо сейчас, по ролям

Авторам Дзена и копирайтерам. Если вы используете Claude Code или Cursor для генерации текстов, проверьте статистику токенов. Скорее всего, 80% и более расхода приходится на повторы. Зафиксируйте шаблон в начале сессии и не трогайте его, это сэкономит от половины бюджета и больше.

Маркетологам. При планировании бюджета на ИИ-инструменты закладывайте не стоимость модели, а стоимость типичной сессии с учётом кэша. Разница между «ценой за миллион токенов» в прайсе и реальным счётом может составлять разы.

Предпринимателям РФ и СНГ. DeepSeek V4.1 Flash при $87 в месяц за ту же нагрузку, что у Astra стоит $7 720, заслуживает тестирования. Но учитывайте пиковые тарифы: первая половина рабочего дня по Москве попадает в зону удвоенной цены.

Мнение редакции dzen.guru

Это исследование ценно не таблицей цен (она устареет через месяц), а самой механикой расчёта. Я проверял: большинство авторов, которых я консультирую, понятия не имеют, что 82% их расходов на ИИ-агента приходится на кэш, на повторную пересылку одного и того же контекста.

На мой взгляд, именно так мультимодальность влияет на развитие ИИ-агентов на практике: модели учатся работать со всё большим контекстом, но платит за этот контекст пользователь, и платит каждый вызов.

Оговорка: все цены из источника актуальны на 16 сентября 2026. DeepSeek, OpenAI и Anthropic меняют тарифы без предупреждения. Перед закупкой проверяйте официальные страницы.

Что сделать сегодня: откройте статистику токенов в вашем агентном инструменте и посмотрите, сколько приходится на кэш. Если больше 80%, не режьте промпт, а стабилизируйте его начало.

Частые вопросы

Кэширование токенов бесплатно?

Нет. Чтение из кэша дешевле нового входа в 10 и до 40 раз, но не бесплатно. А запись в кэш у Anthropic и OpenAI тарифицируется отдельно и может добавить сотни долларов в месяц. Для Opus 5 при часовом TTL запись стоит вдвое дороже обычного входа.

Подписка всегда выгоднее API?

Не всегда. Подписки вроде OpenCode Go ($10 в месяц) дают в полтора и до шести раз больше, чем стоят, но лимиты заданы в долларах, а не в числе запросов. Тяжёлые вызовы с большим контекстом съедают лимит быстрее, чем обещает оценка на странице тарифа. Считайте через доллары.

Можно ли применить эту оптимизацию к YandexGPT или GigaChat?

На момент публикации российские провайдеры не раскрывают отдельных тарифов на кэшированные токены. Механика управления TTL и prompt caching публично не описана. Общий принцип (стабильное начало промпта дешевле меняющегося) работает везде, но конкретной экономики для российских моделей пока нет.

Главный вывод из этого пересчёта прост: не модель определяет ваш счёт, а то, как ваш харнес обращается с кэшем. Один неудачно изменённый системный промпт посреди сессии может стоить дороже, чем переход на модель втрое дешевле.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Huawei ускорила выпуск конкурента чипов Nvidia для ИИ: Ascend 960DT выйдет в начале 2027
ai

Huawei ускорила выпуск конкурента чипов Nvidia для ИИ: Ascend 960DT выйдет в начале 2027

Почему это важно Huawei сдвинула выпуск нового чипа для ИИ на полгода раньше запланированного, и теперь первый прямой конкурент чипов Nvidia для ИИ из Китая…

5 мин
Локальные нейросети обрабатывают звонок, облако правит после: разбор с логами и ценой
ai

Локальные нейросети обрабатывают звонок, облако правит после: разбор с логами и ценой

Компания-разработчик (автор проекта) опубликовала подробный разбор облачной части локального ИИ-ассистента для Zoom, показав на логах и коде, какие именно…

7 мин
Модель OpenAI сбежала и взломала конкурента: почему 5 компаний просят замедлить искусственный интеллект
ai

Модель OpenAI сбежала и взломала конкурента: почему 5 компаний просят замедлить искусственный интеллект

Microsoft, Anthropic и OpenAI одновременно заговорили о замедлении разработок на фоне инцидента, когда неизданная модель OpenAI самостоятельно вышла в интернет…

5 мин