Сбер описал AI Disrupt PDLC, но цифры расхода токенов расходятся в 4 раза
Сбер в мае выпустил документ AI Disrupt PDLC о перестройке цикла разработки вокруг намерения человека, а автор Игорь Градов за 30 дней агентной работы собрал телеметрию, которая позволяет проверить ключевые цифры этого документа собственными логами.

Документ Сбера содержит внутреннее противоречие: одна и та же цифра мультиагентного расхода токенов (токен — минимальная единица текста, которую считает и тарифицирует модель) употреблена с двумя разными базами сравнения, и разница между прочтениями составляет четыре раза. Для любого, кто планирует бюджет на ИИ-агентов, это два совершенно разных решения.
В сентябре Олег Бунин разобрал AI Disrupt PDLC на Хабре, отделив инженерную рамку от продуктовой витрины Сбера. Но настоящий вопрос к документу не в маркетинге, а в числах: сколько на самом деле стоит агентная (когда ИИ действует самостоятельно, а не отвечает на один вопрос) и мультиагентная работа. Ниже пошаговый разбор того, как вытащить реальные цифры из собственных логов и сопоставить их с ориентирами Сбера.
Что понадобится
- Доступ к Claude Code или Codex CLI (интерфейсы командной строки для работы с ИИ-агентами) с активными сессиями хотя бы за 2 недели
- Умение открыть терминал и запустить скрипт на Python или jq
- Логи сессий: Claude Code хранит их в
~/.claude/projects/<путь>/<session-id>.jsonl, Codex CLI ведёт rollout-логи с полемtotal_token_usage - Таблица тарифов провайдера модели (у Anthropic опубликована на сайте)
- Оба варианта документа Сбера: короткая версия и полная на 175 страниц
- Примерно 3 часа на первый подсчёт, включая исправление типичных ошибок
Пошаговая инструкция
-
Скачайте обе версии AI Disrupt PDLC. Найдите разделы 2.9 и 5.2 полной версии. Выпишите две формулировки про мультиагентный расход: в 2.9 сказано «в 15 раз больше токенов, чем одиночный агент», в 5.2 сказано «агенты потребляют примерно в 4 раза больше токенов, чем чат, а мультиагентные системы примерно в 15 раз больше». Зафиксируйте: по 5.2 мультиагент к одиночному агенту выходит 15/4, то есть 3,75x, а по 2.9 те же 15x отнесены прямо к одиночному агенту.
-
Соберите логи Claude Code. Файлы лежат в формате JSONL. У каждого ответа модели есть блок
usageс полямиinput_tokens,output_tokens,cache_creation_input_tokens,cache_read_input_tokens. Пример чтения одной сессии:
cat ~/.claude/projects/myproject/session-abc123.jsonl \
| jq -s '[.[] | select(.usage)] | unique_by(.message.id) | [.[].usage.output_tokens] | add'
-
Избегайте первой ловушки: дедупликация по
message.id. Claude Code повторяет блокusageв каждой строке одного ответа. Если ответ состоит из нескольких блоков, строк будет несколько, аusageво всех одинаковый. Суммирование построчно завышает результат в 1,7 раза (на реальном 30-дневном окне), а по основным файлам сессий без субагентов — в 2,1 раза. Считайте один раз наmessage.id. -
Не забудьте субагентов. Их транскрипты лежат отдельно, в
<session-id>/subagents/*.jsonl. Если обходить только верхний уровень, сессии с субагентами (субагент — дочерний ИИ-агент, которого запускает основной агент для подзадачи) выглядят дешевле реального расхода. Припишите расход субагентов к родительской сессии. -
Для Codex CLI берите приращения
total_token_usage. Полеlast_token_usageповторяется в служебных событиях без нового запроса. Надёжный способ: считать разницу между последовательными значениями накопительногоtotal_token_usage. -
Разделите сессии на две группы: с субагентами и без. Посчитайте средний расход токенов на сессию в каждой группе. Именно это соотношение и есть ваш эмпирический мультиагентный коэффициент.
-
Пересчитайте кэш-экономию. В разделе 4.4 короткой версии AI Disrupt PDLC заявлено «до 10-кратного снижения стоимости входных токенов при повторах». Возьмите свои входные токены, разбейте по моделям (у разных моделей разный множитель чтения кэша: 0,1 у большинства, 0,05 у Opus 5.5, 0,025 у Fable 5.1), учтите стоимость записи (1,25 или 2 от цены входа в зависимости от срока хранения) и сравните итоговую цену с ценой без кэша.
-
Сопоставьте результат с документом. Ваши данные покажут, насколько ориентиры Сбера совпадают с реальным расходом при вашем характере работы.
За 30 дней (с 23 августа по 21 сентября 2026) при смешанной работе — разработка, управленческая рутина, разбор документов, переписка плюс автоматические прогоны по расписанию — получилось 320 сессий. Из них 29 с субагентами (509 запусков, 561 файл транскриптов), остальные 291 шли одним агентным контекстом.
Соотношение среднего расхода сессий с субагентами к сессиям без них составило 33x. Если взять ориентир из раздела 2.9 документа Сбера (15x к одиночному агенту) и умножить средний расход сессии без субагентов на 15, прогноз для сессий с субагентами недооценит их реальный расход примерно вдвое.
По кэшу: тарифный пересчёт по реальному распределению моделей и типов кэша показал почти восьмикратную экономию на входных токенах — при заявленном «до десяти». Значение совместимо с ориентиром документа, хотя точная доля экономии именно на системных инструкциях из телеметрии не извлекается — логи не различают, где инструкции и где рабочий контекст.
Противоречие в документе: 15x от чего?
Ключевое, что стоит понять перед любым планированием бюджета. В разделе 5.2 полной версии AI Disrupt PDLC цифра 15x атрибутирована Anthropic и относится к сравнению мультиагентной системы с чатом. Одиночный агент при этом даёт 4x к чату. Значит мультиагент к одиночному агенту выходит 3,75x.
В разделе 2.9 те же 15x отнесены уже напрямую к одиночному агенту. К чату это было бы 60x. Разница между двумя прочтениями — четырёхкратная.
Цифра 15 при этом не принадлежит Сберу: в исходной публикации Anthropic она тоже про сравнение с чатом. В 2.9, вероятно, её пересказали с потерей базы сравнения. Документ не объясняет, что речь о разных режимах или выборках.
Почему 33x не равно «мультиагентной надбавке»?
Сравнение не контролируемое. Субагенты запускались на крупных задачах, а среди сессий без них много коротких автоматических прогонов. В соотношении 33x смешаны цена мультиагентной схемы и размер задачи, и развести их такие данные не позволяют — для этого нужен замер одинаковых задач в двух режимах.
Дополнительный фактор — состав моделей. По выходным токенам субагенты на две трети работали на Sonnet 5, основной контекст сессий с ними — на Opus 5 и Fable 5.1, а сессии без субагентов — в основном на Opus 5. Модели различаются по «многословности», поэтому токены у двух групп не вполне сопоставимы.
Сессий с субагентами всего 29, так что средние неустойчивы.
Что делать с этим прямо сейчас?
Автору Дзена и копирайтеру. Если вы используете ИИ-агентов для подготовки контента, проверьте, сколько токенов реально уходит на сессию. Логи пишутся сами. Сравните свой расход с ориентирами документа Сбера и решите, окупается ли мультиагентный режим для ваших задач или одиночный агент выгоднее.
Маркетологу и менеджеру продукта. Прежде чем закладывать бюджет на агентную архитектуру, разберитесь, какую базу сравнения берёт ваш поставщик. Четырёхкратная разница между прочтениями одного документа — это разница между «укладываемся» и «перерасход».
Предпринимателю в РФ. Claude Code и Codex CLI доступны, хотя и с нюансами оплаты через зарубежные карты. Из доступных в РФ инструментов для агентной работы — GigaChat от того же Сбера и YandexGPT, но их логирование устроено иначе и аналогичный подсчёт потребует адаптации скриптов.
Три ловушки, на каждую автор наступил лично:
- Построчное суммирование
usageв Claude Code. Ответ из нескольких блоков дублируетusageв каждой строке. Без дедупликации поmessage.idрасход завышается в 1,7 раза и более. - Игнорирование субагентов. Их транскрипты лежат в подпапке
subagents/. Пропустите — и дорогие сессии покажутся дешёвыми. - Использование
last_token_usageв Codex CLI вместо приращенийtotal_token_usage. Поле повторяется в служебных событиях и создаёт ложные записи.
Документ AI Disrupt PDLC полезен как карта ориентиров: кэш-экономия «до 10x» подтверждается (по моим данным — почти 8x), бюджетные рамки на сессию дают точку отсчёта. Но к числам про мультиагентный расход стоит подходить с калькулятором и собственными логами, а не на веру.
Я проверил одну цифру — и нашёл четырёхкратное расхождение в самом документе. Это не обвинение: 175 страниц пишут живые люди, и потеря базы сравнения при пересказе — типичная редакторская ошибка. Но если вы строите на этих числах бюджет, цена ошибки ваша.
Честная оговорка: мои 320 сессий — это опыт одного человека со смешанной нагрузкой. Контролируемого эксперимента «одна задача в двух режимах» тут нет. Соотношение 33x отражает не чистую мультиагентную надбавку, а смесь надбавки с масштабом задач. Для точной калибровки нужна выборка побольше и однородные задачи.
Попробуйте промпт-конструктор dzen.guru
Составьте системный промпт для агентной работы и проверьте, как меняется расход токенов при разных настройках
Попробовать конструкторПланировать бюджет на ИИ-агентов по чужому документу без собственных замеров — всё равно что верстать смету по чужой квартире: метраж похож, а стены не там. Скачайте свои логи, прогоните скрипт, и через три часа у вас будет собственная цифра, которая точнее любого ориентира.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

LLM проваливают тест Тьюринга на третьем сообщении: кейс из дейтинга
Недавний пост практика из ниши дейтинг-аутстаффа заново поднял вопрос, который индустрия обходит стороной: способны ли большие языковые модели (LLM, модели…

Jev guard модель для защиты языковых моделей
Почему это важно Впервые guard-модель на основе энкодера заявляет контекстное окно в 32 000–64 000 токенов и работает с русским языком, но у неё есть…

Что такое ИИ-агент на практике: 5 ловушек, которые остановили агрегатор Telegram-каналов
Идея собрать ИИ-агрегатор Telegram-каналов с аудиодайджестом звучит красиво, но разработчик-одиночка, который строит такой продукт в России, столкнулся с пятью…
Комментарии