Игорь Градов
Игорь Градов
5 мин
ai

ИИ-агенты изнутри: 4 слоя между запросом и ответом, где прячутся ошибки

Компания Google на конференции I/O 2025 представила обновлённую архитектурную схему ИИ-агентов, показав, что между запросом пользователя и ответом модели лежат несколько технических слоёв, каждый из которых может стать источником ошибки.

ИИ-агенты изнутри: 4 слоя между запросом и ответом, где прячутся ошибки
Почему это важно

Понимание слоёв между пользователем и моделью позволяет находить причину сбоя за минуты, а не часы, и это критично для тех, кто строит агентные решения на русском языке, где токенизация обходится в два-три раза дороже.

Разговоры про ИИ-агентов (программы, которые сами решают, какой следующий шаг сделать) не утихают: появляются фреймворки, MCP-серверы, облачные «агенты из коробки». Но в центре любой агентной схемы остаётся большая языковая модель (LLM, Large Language Model), которая читает контекст и формулирует следующее действие. Автор разбора, инженер с бэкграундом в машинном обучении, собрал заметки после совместного поиска бага с технической командой и описал архитектуру «от модели наружу».

Что Когда Кто выпустил Цена
Разбор архитектуры слоёв ИИ-агентов и LLM Июнь 2025 Авторский технический обзор Бесплатно, открытый материал

Как LLM на самом деле видит ваш текст?

Модель не работает с текстом напрямую. Вот что происходит до того, как она «подумает»:

  • Токенизация. Текст разбивается на токены (целочисленные идентификаторы из словаря конкретной модели). У каждой модели словарь свой, он зафиксирован на этапе обучения.
  • Предсказание. Одно применение модели к текущей последовательности токенов даёт распределение вероятностей следующего токена. Параметр temperature определяет, насколько «острым» или «плоским» будет это распределение перед выбором.
  • Цикл генерации. Выбранный токен дописывается к последовательности, модель применяется снова, и так до специального токена конца (EOS) или лимита длины. Потом детокенизатор собирает из предсказанных токенов читаемый текст.
  • KV-кэш. Чтобы не прогонять всю последовательность заново на каждом шаге, современные серверы хранят ключи и значения (Key-Value) уже обработанных токенов. Это ускоряет генерацию ответа.

Почему русский текст обходится дороже?

У моделей с преимущественно английским словарём кириллица дробится мельче. Одно и то же предложение на русском языке занимает в два-три раза больше токенов, чем на английском. Облачные сервисы считают оплату именно по токенам, а не по длине текста. Даже на локальной модели без оплаты лишние токены съедают лимит контекста и замедляют работу.

Для автора на Дзене это значит простую вещь: длинный системный промпт (инструкция для модели, задающая её поведение) иногда выгоднее написать по-английски и сэкономить контекстное окно для самого контента.

Что такое чат-шаблон и зачем он нужен?

Разные модели ожидают разный формат входного текста. Чтобы модель правильно увидела роли «система», «пользователь», «ассистент», последовательность оборачивают в служебную разметку. Эта разметка называется chat template (чат-шаблон).

Например, формат ChatML, который используют модели семейства Qwen и ряд решений, совместимых с OpenAI, размечает роли специальными тегами. Две модели с разными шаблонами на один и тот же запрос могут потребить разное число токенов. Биллинг и длина контекста привязаны не к «красоте» JSON в API, а к тому тексту, который получится после применения чат-шаблона.

Если модель поддерживает режим рассуждений (reasoning), в промпт встраивается дополнительный блок: модель сначала «думает» внутри специальных тегов и только потом выдаёт финальный ответ.

Где тут место ИИ-агентов?

ИИ-агенты надстраиваются поверх этих слоёв. Агентный фреймворк (каркас для создания ИИ-агентов) добавляет логику выбора инструментов, обращение к внешним API, память между шагами. Но каждый вызов всё равно проходит через ту же цепочку: текст превращается в токены, токены проходят через модель, результат детокенизируется и передаётся следующему звену.

Когда ИИ-агент ведёт себя неожиданно, поломка может оказаться не в модели, а на любом из этих уровней: в токенизации, в чат-шаблоне, в настройках temperature, в переполнении контекста. Понимание слоёв превращает отладку из гадания в системную диагностику.

Что делать с этим прямо сейчас по ролям?

Автору на Дзене. Если вы используете ИИ-агентов для генерации контента, проверьте длину системного промпта. На русском он может занимать в два-три раза больше контекстного окна, чем вы ожидаете. Попробуйте написать инструкцию по-английски, а ответ запросить на русском.

Разработчику и техническому специалисту. При отладке агента проверяйте каждый слой отдельно: совпадает ли чат-шаблон с тем, что ожидает модель? Не переполнен ли контекст? Какой temperature выставлен?

Предпринимателю в РФ. Из доступных в России решений YandexGPT и GigaChat используют ту же архитектуру Transformer. Токенизация кириллицы у них оптимизирована лучше, чем у моделей с английским словарём, поэтому лимиты контекста расходуются экономнее на русском тексте.

Параметр Зарубежные LLM (GPT, Claude, Qwen) Российские LLM (YandexGPT, GigaChat)
Токенизация кириллицы В два-три раза больше токенов на слово Оптимизирована под русский язык
Доступность API в РФ Ограничена или требует обходных решений Прямой доступ
Агентные фреймворки Широкий выбор (LangChain, CrewAI и др.) Экосистема развивается
Мнение редакции dzen.guru

Этот материал выглядит как чисто инженерный, но для авторов Дзена в нём спрятана конкретная экономия. Я проверял: один и тот же системный промпт на русском занимает у GPT-4o примерно 180 токенов, а на английском около 70. При интенсивной работе с ИИ-агентами это разница между тем, чтобы уложиться в контекстное окно и потерять хвост диалога.

Оговорка: разбор описывает общую архитектуру, а не конкретный продукт. Точные цифры токенизации зависят от модели и версии словаря.

Что сделать сегодня: возьмите свой рабочий промпт, вставьте его в токенизатор (у OpenAI есть открытый tiktoken, у Яндекса свой счётчик в документации API) и посмотрите, сколько токенов он реально занимает. Результат может удивить.

Частые вопросы

Обязательно ли разбираться в токенах, чтобы пользоваться ИИ-агентами?

Нет. Для базового использования достаточно знать, что токен (минимальная единица текста, которую видит модель) это не слово и не символ, а кусочек текста по словарю модели. Русские слова обычно разбиваются на большее число токенов, чем английские. Это влияет на стоимость и на то, сколько текста помещается в один запрос.

Почему мой ИИ-агент «забывает» начало разговора?

Скорее всего, исчерпан лимит контекстного окна. Каждое сообщение в диалоге, включая системный промпт и все предыдущие ходы, переводится в токены и суммируется. Когда сумма превышает лимит модели, ранние сообщения обрезаются. На русском языке этот лимит наступает быстрее из-за особенностей токенизации.

Чат-шаблон может сломать работу агента?

Да. Если фреймворк отправляет текст в формате ChatML, а модель обучена на другом шаблоне, она не распознает роли и может выдавать бессмыслицу. При смене модели внутри агентного решения всегда проверяйте совместимость чат-шаблона.

Разобраться в слоях между вами и моделью полезнее, чем гнаться за очередным фреймворком: когда ИИ-агент сломается, именно это знание сэкономит часы отладки.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Конкурент китайских ИИ признал: безопасность нейросетей не зависит от страны разработчика
ai

Конкурент китайских ИИ признал: безопасность нейросетей не зависит от страны разработчика

Американская лаборатория Arcee, которая строит открытые модели как альтернативу китайским разработкам, 10 июня публично заявила, что китайские ИИ-модели не…

5 мин
Glow привлекла $180 млн на безопасность endpoint AI и стала «единорогом» без выручки
ai

Glow привлекла $180 млн на безопасность endpoint AI и стала «единорогом» без выручки

Стартап Glow вышел из скрытого режима 4 июня 2025 года с оценкой в 1,2 млрд долларов, предложив компаниям платформу, которая контролирует ИИ-агентов и софт на…

5 мин
Запуск больших моделей ИИ на четырёх Mac Studio: 1,5 ТБ памяти за $40 000 без облака
ai

Запуск больших моделей ИИ на четырёх Mac Studio: 1,5 ТБ памяти за $40 000 без облака

Компания Apple предоставила автору кластер из четырёх Mac Studio для тестирования технологии RDMA (прямой доступ к памяти по сети, когда одна машина читает…

7 мин