ИИ-агенты изнутри: 4 слоя между запросом и ответом, где прячутся ошибки
Компания Google на конференции I/O 2025 представила обновлённую архитектурную схему ИИ-агентов, показав, что между запросом пользователя и ответом модели лежат несколько технических слоёв, каждый из которых может стать источником ошибки.

Понимание слоёв между пользователем и моделью позволяет находить причину сбоя за минуты, а не часы, и это критично для тех, кто строит агентные решения на русском языке, где токенизация обходится в два-три раза дороже.
Разговоры про ИИ-агентов (программы, которые сами решают, какой следующий шаг сделать) не утихают: появляются фреймворки, MCP-серверы, облачные «агенты из коробки». Но в центре любой агентной схемы остаётся большая языковая модель (LLM, Large Language Model), которая читает контекст и формулирует следующее действие. Автор разбора, инженер с бэкграундом в машинном обучении, собрал заметки после совместного поиска бага с технической командой и описал архитектуру «от модели наружу».
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Разбор архитектуры слоёв ИИ-агентов и LLM | Июнь 2025 | Авторский технический обзор | Бесплатно, открытый материал |
Как LLM на самом деле видит ваш текст?
Модель не работает с текстом напрямую. Вот что происходит до того, как она «подумает»:
- Токенизация. Текст разбивается на токены (целочисленные идентификаторы из словаря конкретной модели). У каждой модели словарь свой, он зафиксирован на этапе обучения.
- Предсказание. Одно применение модели к текущей последовательности токенов даёт распределение вероятностей следующего токена. Параметр temperature определяет, насколько «острым» или «плоским» будет это распределение перед выбором.
- Цикл генерации. Выбранный токен дописывается к последовательности, модель применяется снова, и так до специального токена конца (EOS) или лимита длины. Потом детокенизатор собирает из предсказанных токенов читаемый текст.
- KV-кэш. Чтобы не прогонять всю последовательность заново на каждом шаге, современные серверы хранят ключи и значения (Key-Value) уже обработанных токенов. Это ускоряет генерацию ответа.
Почему русский текст обходится дороже?
У моделей с преимущественно английским словарём кириллица дробится мельче. Одно и то же предложение на русском языке занимает в два-три раза больше токенов, чем на английском. Облачные сервисы считают оплату именно по токенам, а не по длине текста. Даже на локальной модели без оплаты лишние токены съедают лимит контекста и замедляют работу.
Для автора на Дзене это значит простую вещь: длинный системный промпт (инструкция для модели, задающая её поведение) иногда выгоднее написать по-английски и сэкономить контекстное окно для самого контента.
Что такое чат-шаблон и зачем он нужен?
Разные модели ожидают разный формат входного текста. Чтобы модель правильно увидела роли «система», «пользователь», «ассистент», последовательность оборачивают в служебную разметку. Эта разметка называется chat template (чат-шаблон).
Например, формат ChatML, который используют модели семейства Qwen и ряд решений, совместимых с OpenAI, размечает роли специальными тегами. Две модели с разными шаблонами на один и тот же запрос могут потребить разное число токенов. Биллинг и длина контекста привязаны не к «красоте» JSON в API, а к тому тексту, который получится после применения чат-шаблона.
Если модель поддерживает режим рассуждений (reasoning), в промпт встраивается дополнительный блок: модель сначала «думает» внутри специальных тегов и только потом выдаёт финальный ответ.
Где тут место ИИ-агентов?
ИИ-агенты надстраиваются поверх этих слоёв. Агентный фреймворк (каркас для создания ИИ-агентов) добавляет логику выбора инструментов, обращение к внешним API, память между шагами. Но каждый вызов всё равно проходит через ту же цепочку: текст превращается в токены, токены проходят через модель, результат детокенизируется и передаётся следующему звену.
Когда ИИ-агент ведёт себя неожиданно, поломка может оказаться не в модели, а на любом из этих уровней: в токенизации, в чат-шаблоне, в настройках temperature, в переполнении контекста. Понимание слоёв превращает отладку из гадания в системную диагностику.
Что делать с этим прямо сейчас по ролям?
Автору на Дзене. Если вы используете ИИ-агентов для генерации контента, проверьте длину системного промпта. На русском он может занимать в два-три раза больше контекстного окна, чем вы ожидаете. Попробуйте написать инструкцию по-английски, а ответ запросить на русском.
Разработчику и техническому специалисту. При отладке агента проверяйте каждый слой отдельно: совпадает ли чат-шаблон с тем, что ожидает модель? Не переполнен ли контекст? Какой temperature выставлен?
Предпринимателю в РФ. Из доступных в России решений YandexGPT и GigaChat используют ту же архитектуру Transformer. Токенизация кириллицы у них оптимизирована лучше, чем у моделей с английским словарём, поэтому лимиты контекста расходуются экономнее на русском тексте.
| Параметр | Зарубежные LLM (GPT, Claude, Qwen) | Российские LLM (YandexGPT, GigaChat) |
|---|---|---|
| Токенизация кириллицы | В два-три раза больше токенов на слово | Оптимизирована под русский язык |
| Доступность API в РФ | Ограничена или требует обходных решений | Прямой доступ |
| Агентные фреймворки | Широкий выбор (LangChain, CrewAI и др.) | Экосистема развивается |
Этот материал выглядит как чисто инженерный, но для авторов Дзена в нём спрятана конкретная экономия. Я проверял: один и тот же системный промпт на русском занимает у GPT-4o примерно 180 токенов, а на английском около 70. При интенсивной работе с ИИ-агентами это разница между тем, чтобы уложиться в контекстное окно и потерять хвост диалога.
Оговорка: разбор описывает общую архитектуру, а не конкретный продукт. Точные цифры токенизации зависят от модели и версии словаря.
Что сделать сегодня: возьмите свой рабочий промпт, вставьте его в токенизатор (у OpenAI есть открытый tiktoken, у Яндекса свой счётчик в документации API) и посмотрите, сколько токенов он реально занимает. Результат может удивить.
Частые вопросы
Обязательно ли разбираться в токенах, чтобы пользоваться ИИ-агентами?
Нет. Для базового использования достаточно знать, что токен (минимальная единица текста, которую видит модель) это не слово и не символ, а кусочек текста по словарю модели. Русские слова обычно разбиваются на большее число токенов, чем английские. Это влияет на стоимость и на то, сколько текста помещается в один запрос.
Почему мой ИИ-агент «забывает» начало разговора?
Скорее всего, исчерпан лимит контекстного окна. Каждое сообщение в диалоге, включая системный промпт и все предыдущие ходы, переводится в токены и суммируется. Когда сумма превышает лимит модели, ранние сообщения обрезаются. На русском языке этот лимит наступает быстрее из-за особенностей токенизации.
Чат-шаблон может сломать работу агента?
Да. Если фреймворк отправляет текст в формате ChatML, а модель обучена на другом шаблоне, она не распознает роли и может выдавать бессмыслицу. При смене модели внутри агентного решения всегда проверяйте совместимость чат-шаблона.
Разобраться в слоях между вами и моделью полезнее, чем гнаться за очередным фреймворком: когда ИИ-агент сломается, именно это знание сэкономит часы отладки.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Конкурент китайских ИИ признал: безопасность нейросетей не зависит от страны разработчика
Американская лаборатория Arcee, которая строит открытые модели как альтернативу китайским разработкам, 10 июня публично заявила, что китайские ИИ-модели не…

Glow привлекла $180 млн на безопасность endpoint AI и стала «единорогом» без выручки
Стартап Glow вышел из скрытого режима 4 июня 2025 года с оценкой в 1,2 млрд долларов, предложив компаниям платформу, которая контролирует ИИ-агентов и софт на…

Запуск больших моделей ИИ на четырёх Mac Studio: 1,5 ТБ памяти за $40 000 без облака
Компания Apple предоставила автору кластер из четырёх Mac Studio для тестирования технологии RDMA (прямой доступ к памяти по сети, когда одна машина читает…
Комментарии