Игорь Градов
Игорь Градов
5 мин
ai

6 способов снизить расходы на AI агентов: кэш, сжатие и ленивая подгрузка

Компания Anthropic, создатель модели Claude, позволяет кэшировать (запоминать без повторной оплаты) не только системные инструкции, но и саму историю переписки. Это значит, что на каждом новом сообщении AI перечитывает заново только то, что добавилось, а не весь разговор с начала.

6 способов снизить расходы на AI агентов: кэш, сжатие и ленивая подгрузка

Что сделала: включила кэширование для истории сообщений. Теперь на каждом новом ответе AI «помнит» предыдущие реплики дёшево, а платит полную цену только за новое сообщение и свежие данные. Это особенно заметно в длинных синк-сессиях, где раньше стоимость каждого следующего ответа росла экспоненциально.

💬 Промпт: Включи кэширование для массива messages, который мы отправляем в Anthropic API. На каждом вызове ставь cache_control на последнее сообщение в массиве — чтобы всё, что было до него, бралось из памяти. Убедись, что мы не дублируем историю: отправляй ровно один массив messages с полной историей, а не пересобирай его заново.

  1. Не повторять сказанное: убрали дублирование данных Раньше в каждом сообщении AI получал одни и те же данные дважды: один раз в системном промпте («вот профиль пользователя»), второй раз — внутри истории переписки (потому что агент сам туда это записал ранее). Получалось, что мы платим за одну и ту же информацию дважды.

Что сделала: провела аудит всех данных, которые передаются в каждом вызове. Убрала дублирование: если данные уже есть в системном промпте, они не повторяются в истории сообщений. Если агент обновил профиль пользователя — обновляется только системный промпт, а из истории старая версия удаляется.

💬 Промпт: Проверь, какие данные мы передаём в Claude дважды — и в system prompt, и внутри messages. Покажи мне список дублей. Убери дублирование: каждый кусок данных должен быть ровно в одном месте. Статичные справочные данные — в system prompt с кэшированием, динамические — в отдельном блоке system prompt без кэша. В messages оставь только реальную переписку.

  1. Сжатие истории переписки Даже с кэшированием, длинный разговор — это длинный массив сообщений. А чем он длиннее, тем дороже даже кэшированное чтение (оно дешевле полного, но не бесплатное).

Что сделала: после каждых 10 сообщений агент делает «конспект» разговора — краткое резюме того, что обсудили и к чему пришли. Старые сообщения заменяются этим конспектом. AI продолжает разговор, опираясь на конспект + последние 10 сообщений, а не на полную историю.

💬 Промпт: Добавь механизм суммаризации переписки. После каждых 10 сообщений пользователя: (1) попроси Claude кратко пересказать ключевые факты и решения из старых сообщений (не больше 500 токенов); (2) замени старые сообщения этим конспектом; (3) оставь последние 10 сообщений как есть. Убедись, что конспект не теряет важные решения и цифры.

  1. Укоротили сами инструкции Системные промпты разрослись до огромных размеров. Каждый агент получал подробные инструкции на все случаи жизни, включая сценарии, которые случаются раз в месяц.

Что сделала: сократила системные промпты в среднем на 40%. Убрала примеры, которые дублируют друг друга. Заменила длинные объяснения короткими правилами. Редкие сценарии вынесла в отдельные инструкции, которые подгружаются только когда нужны (например, инструкция по работе с инвестором подгружается только когда пользователь запускает симуляцию питча).

💬 Промпт: Покажи мне длину (в токенах) системного промпта для каждого агента. Для самого длинного: (1) найди повторяющиеся примеры и правила — объедини; (2) найди сценарии, которые срабатывают реже чем в 10% разговоров — вынеси в отдельный файл, подгружай только по триггеру; (3) замени многословные объяснения короткими правилами. Цель — сократить на 30–50% без потери поведения.

  1. Ленивая подгрузка инструментов У каждого агента есть набор «инструментов» (tools) — функций, которые он может вызвать: обновить профиль, поставить цель, запланировать синк. Раньше все инструменты передавались в каждом вызове, даже если в конкретном разговоре агент использует только 2 из 12.

Что сделала: разделила инструменты на «базовые» (нужны всегда) и «дополнительные» (нужны по ситуации). Базовые передаются в каждом вызове. Дополнительные подгружаются только когда контекст разговора показывает, что они могут понадобиться.

💬 Промпт: Покажи список всех tools, которые мы передаём каждому агенту. Для каждого tool покажи процент вызовов, в которых он реально использовался за последний месяц. Tools с использованием ниже 20% — вынеси в «ленивую» группу. Подгружай их только если в последнем сообщении пользователя есть ключевые слова или если агент явно запросил расширенный набор инструментов.

  1. Выбор модели под задачу Не все задачи требуют самой умной (и дорогой) модели. Например, суммаризация переписки или извлечение структурированных данных из текста — это простые задачи, с которыми справляется модель попроще.

Что сделала: для вспомогательных задач (суммаризация, извлечение данных, классификация намерения пользователя) переключилась на Claude Haiku — она в 10-15 раз дешевле Sonnet. Основной разговор по-прежнему ведёт Sonnet 4, но рутинные операции делает Haiku.

💬 Промпт: Найди все места, где мы вызываем Claude для вспомогательных задач: суммаризация, извлечение полей из текста, классификация intent. Переведи эти вызовы на claude-haiku. Убедись, что качество не упало: прогони 20 реальных примеров через обе модели и сравни результаты.

  1. Мониторинг и алерты Без постоянного отслеживания расходов невозможно понять, что работает, а что нет. После каждой оптимизации нужно видеть, как изменилась стоимость конкретного сценария.

Что сделала: настроила логирование каждого вызова к API с разбивкой по агентам, сценариям и типам токенов (входные, выходные, кэшированные). Добавила алерт: если стоимость одного сценария превышает порог — приходит уведомление.

💬 Промпт: Добавь логирование для каждого вызова Anthropic API. Записывай: (1) какой агент вызвал; (2) какой сценарий (регистрация, синк, чат); (3) количество input/output/cache_read/cache_creation токенов; (4) стоимость в долларах. Сделай дашборд, который показывает среднюю стоимость по сценарию за день. Добавь алерт в Slack, если средняя стоимость синка превысит $0.80.

Итого: после всех восьми шагов стоимость регистрации снизилась с ~$1.00 до $0.30–0.50, а синк-сессии — с ~$1.20 до $0.50–0.70. Модель осталась той же — Claude Sonnet 4. Качество ответов не пострадало: пользователи не заметили разницы.

Главный вывод: большая часть экономии пришла не от смены модели или урезания функций, а от того, как именно данные передаются в API. Кэширование системного промпта и истории переписки дало около 55% экономии — это был самый крупный рычаг.

Ссылка на источник: https://teletype.in/@yuliagdesign/cost-optimization-ai-agents

Угол подачи: Практический гайд по оптимизации расходов на AI-агентов: 8 конкретных приёмов с промптами, которые автор использовала в своём стартапе и снизила стоимость сессии более чем вдвое

Source name: Юлия Гончарова, Teletype Source URL: https://teletype.in/@yuliagdesign/cost-optimization-ai-agents

Текущая дата: 28 июня 2025, суббота

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Что такое ИИ-агент в продакшене: 5 уроков Intel о плотности нагрузки
ai

Что такое ИИ-агент в продакшене: 5 уроков Intel о плотности нагрузки

Компания Intel провела тысячи экспериментов с агентными нагрузками на открытом бенчмарке Terminal-Bench и сформулировала пять практических уроков для тех, кто…

6 мин
Cursor ИИ-редактор кода снизил цену втрое: $7 за подписку в Индии перед сделкой на $60 млрд
ai

Cursor ИИ-редактор кода снизил цену втрое: $7 за подписку в Индии перед сделкой на $60 млрд

Cursor, популярный ИИ-редактор кода, 23 июня запустил первую в своей истории подписку для конкретной страны, тариф Cursor Start за 649 рупий в месяц (около 7…

6 мин
Claude 3.5 Opus возглавил сводный бенчмарк, обойдя GPT-4.1 и Gemini в логике
ai

Claude 3.5 Opus возглавил сводный бенчмарк, обойдя GPT-4.1 и Gemini в логике

Claude Opus 5 показал лучшие результаты среди всех моделей в задачах на логику, оптимизацию и планирование, по данным сводного бенчмарка Artificial Analysis,…

4 мин