6 способов снизить расходы на AI агентов: кэш, сжатие и ленивая подгрузка
Компания Anthropic, создатель модели Claude, позволяет кэшировать (запоминать без повторной оплаты) не только системные инструкции, но и саму историю переписки. Это значит, что на каждом новом сообщении AI перечитывает заново только то, что добавилось, а не весь разговор с начала.

Что сделала: включила кэширование для истории сообщений. Теперь на каждом новом ответе AI «помнит» предыдущие реплики дёшево, а платит полную цену только за новое сообщение и свежие данные. Это особенно заметно в длинных синк-сессиях, где раньше стоимость каждого следующего ответа росла экспоненциально.
💬 Промпт: Включи кэширование для массива messages, который мы отправляем в Anthropic API. На каждом вызове ставь cache_control на последнее сообщение в массиве — чтобы всё, что было до него, бралось из памяти. Убедись, что мы не дублируем историю: отправляй ровно один массив messages с полной историей, а не пересобирай его заново.
- Не повторять сказанное: убрали дублирование данных Раньше в каждом сообщении AI получал одни и те же данные дважды: один раз в системном промпте («вот профиль пользователя»), второй раз — внутри истории переписки (потому что агент сам туда это записал ранее). Получалось, что мы платим за одну и ту же информацию дважды.
Что сделала: провела аудит всех данных, которые передаются в каждом вызове. Убрала дублирование: если данные уже есть в системном промпте, они не повторяются в истории сообщений. Если агент обновил профиль пользователя — обновляется только системный промпт, а из истории старая версия удаляется.
💬 Промпт: Проверь, какие данные мы передаём в Claude дважды — и в system prompt, и внутри messages. Покажи мне список дублей. Убери дублирование: каждый кусок данных должен быть ровно в одном месте. Статичные справочные данные — в system prompt с кэшированием, динамические — в отдельном блоке system prompt без кэша. В messages оставь только реальную переписку.
- Сжатие истории переписки Даже с кэшированием, длинный разговор — это длинный массив сообщений. А чем он длиннее, тем дороже даже кэшированное чтение (оно дешевле полного, но не бесплатное).
Что сделала: после каждых 10 сообщений агент делает «конспект» разговора — краткое резюме того, что обсудили и к чему пришли. Старые сообщения заменяются этим конспектом. AI продолжает разговор, опираясь на конспект + последние 10 сообщений, а не на полную историю.
💬 Промпт: Добавь механизм суммаризации переписки. После каждых 10 сообщений пользователя: (1) попроси Claude кратко пересказать ключевые факты и решения из старых сообщений (не больше 500 токенов); (2) замени старые сообщения этим конспектом; (3) оставь последние 10 сообщений как есть. Убедись, что конспект не теряет важные решения и цифры.
- Укоротили сами инструкции Системные промпты разрослись до огромных размеров. Каждый агент получал подробные инструкции на все случаи жизни, включая сценарии, которые случаются раз в месяц.
Что сделала: сократила системные промпты в среднем на 40%. Убрала примеры, которые дублируют друг друга. Заменила длинные объяснения короткими правилами. Редкие сценарии вынесла в отдельные инструкции, которые подгружаются только когда нужны (например, инструкция по работе с инвестором подгружается только когда пользователь запускает симуляцию питча).
💬 Промпт: Покажи мне длину (в токенах) системного промпта для каждого агента. Для самого длинного: (1) найди повторяющиеся примеры и правила — объедини; (2) найди сценарии, которые срабатывают реже чем в 10% разговоров — вынеси в отдельный файл, подгружай только по триггеру; (3) замени многословные объяснения короткими правилами. Цель — сократить на 30–50% без потери поведения.
- Ленивая подгрузка инструментов У каждого агента есть набор «инструментов» (tools) — функций, которые он может вызвать: обновить профиль, поставить цель, запланировать синк. Раньше все инструменты передавались в каждом вызове, даже если в конкретном разговоре агент использует только 2 из 12.
Что сделала: разделила инструменты на «базовые» (нужны всегда) и «дополнительные» (нужны по ситуации). Базовые передаются в каждом вызове. Дополнительные подгружаются только когда контекст разговора показывает, что они могут понадобиться.
💬 Промпт: Покажи список всех tools, которые мы передаём каждому агенту. Для каждого tool покажи процент вызовов, в которых он реально использовался за последний месяц. Tools с использованием ниже 20% — вынеси в «ленивую» группу. Подгружай их только если в последнем сообщении пользователя есть ключевые слова или если агент явно запросил расширенный набор инструментов.
- Выбор модели под задачу Не все задачи требуют самой умной (и дорогой) модели. Например, суммаризация переписки или извлечение структурированных данных из текста — это простые задачи, с которыми справляется модель попроще.
Что сделала: для вспомогательных задач (суммаризация, извлечение данных, классификация намерения пользователя) переключилась на Claude Haiku — она в 10-15 раз дешевле Sonnet. Основной разговор по-прежнему ведёт Sonnet 4, но рутинные операции делает Haiku.
💬 Промпт: Найди все места, где мы вызываем Claude для вспомогательных задач: суммаризация, извлечение полей из текста, классификация intent. Переведи эти вызовы на claude-haiku. Убедись, что качество не упало: прогони 20 реальных примеров через обе модели и сравни результаты.
- Мониторинг и алерты Без постоянного отслеживания расходов невозможно понять, что работает, а что нет. После каждой оптимизации нужно видеть, как изменилась стоимость конкретного сценария.
Что сделала: настроила логирование каждого вызова к API с разбивкой по агентам, сценариям и типам токенов (входные, выходные, кэшированные). Добавила алерт: если стоимость одного сценария превышает порог — приходит уведомление.
💬 Промпт: Добавь логирование для каждого вызова Anthropic API. Записывай: (1) какой агент вызвал; (2) какой сценарий (регистрация, синк, чат); (3) количество input/output/cache_read/cache_creation токенов; (4) стоимость в долларах. Сделай дашборд, который показывает среднюю стоимость по сценарию за день. Добавь алерт в Slack, если средняя стоимость синка превысит $0.80.
Итого: после всех восьми шагов стоимость регистрации снизилась с ~$1.00 до $0.30–0.50, а синк-сессии — с ~$1.20 до $0.50–0.70. Модель осталась той же — Claude Sonnet 4. Качество ответов не пострадало: пользователи не заметили разницы.
Главный вывод: большая часть экономии пришла не от смены модели или урезания функций, а от того, как именно данные передаются в API. Кэширование системного промпта и истории переписки дало около 55% экономии — это был самый крупный рычаг.
Ссылка на источник: https://teletype.in/@yuliagdesign/cost-optimization-ai-agents
Угол подачи: Практический гайд по оптимизации расходов на AI-агентов: 8 конкретных приёмов с промптами, которые автор использовала в своём стартапе и снизила стоимость сессии более чем вдвое
Source name: Юлия Гончарова, Teletype Source URL: https://teletype.in/@yuliagdesign/cost-optimization-ai-agents
Текущая дата: 28 июня 2025, суббота

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Что такое ИИ-агент в продакшене: 5 уроков Intel о плотности нагрузки
Компания Intel провела тысячи экспериментов с агентными нагрузками на открытом бенчмарке Terminal-Bench и сформулировала пять практических уроков для тех, кто…

Cursor ИИ-редактор кода снизил цену втрое: $7 за подписку в Индии перед сделкой на $60 млрд
Cursor, популярный ИИ-редактор кода, 23 июня запустил первую в своей истории подписку для конкретной страны, тариф Cursor Start за 649 рупий в месяц (около 7…

Claude 3.5 Opus возглавил сводный бенчмарк, обойдя GPT-4.1 и Gemini в логике
Claude Opus 5 показал лучшие результаты среди всех моделей в задачах на логику, оптимизацию и планирование, по данным сводного бенчмарка Artificial Analysis,…
Комментарии