Игорь Градов
Игорь Градов
6 мин
ai

Обучение ИИ-агентов на реальных данных: MTS AI подняла метрику модели 9B с 0,794 до 0,856

Компания MTS AI опубликовала подробное описание процесса сбора обучающих данных для компактных языковых моделей Cotype Pro 3 (27 млрд параметров) и Cotype Light 3 (9 млрд параметров), которые работают как ядро корпоративных ИИ-агентов и мультиагентных систем.

Обучение ИИ-агентов на реальных данных: MTS AI подняла метрику модели 9B с 0,794 до 0,856
Почему это важно

Компактные модели стоят на порядки дешевле в инференсе (вычислении ответа), чем гиганты на сотни миллиардов параметров, но обычно спотыкаются на многошаговых сценариях. Описанный метод поднимает ключевую метрику модели на 9 млрд параметров с 0,794 до 0,856, причём на полностью автономных задачах рост ещё заметнее: с 0,727 до 0,821.

Команда MTS AI рассказала на Хабре, как именно они учат модели Cotype выполнять цепочки действий с инструментами без ошибок. Ключевой выбор: не генерировать «похожие на реальность» диалоги с помощью большой модели, а исполнять каждый вызов инструмента в настоящей базе данных. Разница принципиальна для всех, кто занимается обучением ИИ-агентов для корпоративных задач.

Почему компактным моделям нужны особые данные?

Большие модели на сотни миллиардов параметров обычно справляются с механикой многошаговых сценариев: сверяются со статусом перед записью, не теряют идентификатор между вызовами, не повторяют упавший запрос. Компактные модели (9 и 27 млрд параметров) понимают задачу не хуже, но на механических шагах ошибаются.

Команда MTS AI выделила пять повторяющихся классов ошибок, которые теряют корректность у компактных моделей в сценариях клиентской поддержки. Именно под эти классы собирался обучающий корпус.

Что понадобится

  • Фреймворк τ²-bench (tau2), открытый инструмент для оценки агентов, вызывающих инструменты, в режиме двойного контроля (dual-control), где роли агента и клиента играют отдельные модели
  • Доработка τ²-bench под свои задачи: генерация доменов, сбор трейсов (записей полного хода диалога) с исполнением вызовов в базе, тренировочный контур
  • Среда для RL-обучения: GRPO (алгоритм обучения с подкреплением для языковых моделей) поверх verl-agent gym
  • Реальная база данных с записями о пользователях, товарах, заказах, в которой исполняются все вызовы инструментов
  • Две LLM: одна играет агента, вторая играет клиента

Пошаговая инструкция: как собрать обучающие трейсы

Весь процесс делится на два этапа: подготовка среды и генерация трейсов. Внутри них шесть шагов.

Этап 1. Подготовка среды

  1. ARCHITECT: спроектируйте набор доменов (предметных областей) по нескольким темам. Каждый домен конструируется так, чтобы провоцировать целевые классы ошибок: инструменты, возвращающие идентификаторы, операции, завязанные на состояние, вызовы, которые умеют падать. На выходе не код, а спецификации.

  2. BUILD: скомпилируйте каждую спецификацию в исполняемый домен. Сюда входят модель данных, инструменты, база и политика. Критерий: субагент может отрапортовать об успехе только если домен реально запускается и проходит проверки.

Этап 2. Генерация трейсов

  1. Разыграйте диалог двумя LLM. Одна модель играет агента, другая играет клиента. Сценарий расставляет ловушки: подставляет устаревший email, переводит заказ в статус «доставлен». Но проходит ловушку LLM-агент сам.

  2. Исполните каждый вызов инструмента в реальной базе. Когда агент предлагает вызов, исполнитель инструментов загружает состояние диалога, выполняет вызов со всеми проверками и изменениями в базе и возвращает фактический результат. Ошибка не постановочная: база отвергает неверный аргумент, и агент сам ищет обходной путь.

  3. Соберите трейсы как есть. Попытки, ошибки, развилки попадают в трейс без редактирования. Идентификаторы и суммы переходят из шага в шаг, потому что их вернул вызов, другого источника нет.

  4. Запустите RL-обучение (GRPO) на собранных трейсах. По данным MTS AI, дообучение модели на 9 млрд параметров через GRPO поднимает основную метрику с 0,794 до 0,856. На автономных задачах (ST) рост ещё заметнее: с 0,727 до 0,821.

Синтетика против реальных трейсов: в чём разница?

Существуют два подхода к созданию обучающих данных для обучения ИИ-агентов.

Синтетический путь: LLM «сочиняет» правдоподобный разговор и тут же придумывает ответы инструментов. Быстро и дешево, но ответы инструментов, ошибки, идентификаторы выдуманы. Модель учится на том, что лишь похоже на реальную работу.

Путь с исполнением (grounding): каждый вызов инструмента исполняется в настоящей базе. Ошибка инструмента не постановочная. Развилка определяется статусом сущности, который агент прочитал из базы. Разные варианты прохождения возникают сами, потому что на разные данные база отвечает по-разному.

MTS AI выбрали второй путь. Grounding (привязка к реальным данным) означает, что диалог не просто выглядит правдоподобно, а подтверждён реальным действием.

Как это выглядит на практике

Клиент просит изменить заказ и называет email. ИИ-агент ищет по нему клиента в базе и получает «не найдено»: адрес устарел. Модель на сотни миллиардов параметров обычно меняет признак поиска, находит клиента по имени и индексу, продолжает. Компактная модель без специального обучения чаще повторяет тот же запрос или сообщает «клиент не найден» и закрывает диалог. После дообучения на реальных трейсах компактная модель Cotype Light 3 (9 млрд параметров) выбирает обходной путь, как это делают большие модели, но при стоимости инференса на порядки ниже.

Частые ошибки
  • Синтетические данные без исполнения: если ответы инструментов придуманы LLM, модель запоминает «похожее на реальность» поведение, но не учится реагировать на настоящие ошибки баз данных. Для обучения ИИ-агентов под корпоративные задачи это критичный недостаток.
  • Нет карты ошибок перед генерацией: если не составить классификацию типичных сбоев заранее, корпус будет перекошен: много простых сценариев, мало развилок и восстановлений после ошибок.
  • Потеря идентификаторов между шагами: в синтетическом режиме ID часто генерируются случайно и не совпадают между вызовами. В реальной базе идентификатор один, и он переходит из шага в шаг.
  • Завышенные ожидания от компактных моделей без дообучения: модель на 9 млрд параметров понимает задачу, но механически ошибается. Дообучение на качественных трейсах устраняет разрыв, но не полностью: флагман на 27 млрд параметров по-прежнему точнее.

Что делать с этим прямо сейчас, по ролям

Авторам Дзена и копирайтерам. Если вы используете ИИ-ассистентов для написания текстов, вы уже сталкивались с галлюцинациями (когда ИИ уверенно выдумывает то, чего не было). Метод grounding, привязка к реальным данным, работает и для контентных задач: давайте модели реальные факты, а не просите «придумать пример».

Маркетологам. Агентные (agentic) сценарии в клиентской поддержке вплотную подошли к продакшену на компактных моделях. Это значит, что автоматизация первой линии поддержки перестаёт требовать бюджетов на инференс уровня GPT-4.

Предпринимателям в РФ и СНГ. Cotype, продукт MTS AI, работает в российском контуре. Для компаний, которым важно размещение на своих серверах, компактные модели на 9 и 27 млрд параметров решают задачу, которую раньше закрывали только зарубежные гиганты. Из других доступных в РФ решений для корпоративных агентов стоит смотреть на YandexGPT и GigaChat, но описанный метод сбора трейсов универсален и применим к любой модели.

Мнение редакции dzen.guru

Самое ценное в этой публикации MTS AI не сами модели Cotype, а описание метода. Открытый фреймворк τ²-bench доступен, алгоритм GRPO задокументирован, логика сбора трейсов описана по шагам. Для небольшой команды, которая дообучает компактную модель под свой бизнес-процесс, это готовая методичка: не сочиняйте диалоги, а исполняйте каждый вызов в реальной базе. По моим наблюдениям, большинство проектов по обучению ИИ-агентов в РФ до сих пор идут синтетическим путём, просто потому что он быстрее. Публикация MTS AI показывает, сколько качества теряется на этом компромиссе. Честная оговорка: метод требует работающей инфраструктуры (база, исполнитель инструментов, две LLM для генерации), и для команды из одного человека порог входа высок.

Попробуйте ИИ-инструменты для авторов

Если вы создаёте контент на Дзене и хотите использовать нейросети осмысленно, загляните в наши практические гайды

Перейти на dzen.guru

Метод, который описала MTS AI, переводит обучение ИИ-агентов из режима «нагенерировать побольше похожих диалогов» в режим «каждый шаг подтверждён реальным действием в базе». Для компаний в РФ и СНГ, которые не могут позволить себе модели на сотни миллиардов параметров, это рабочий путь: взять компактную модель, собрать честные трейсы и дообучить. Разница между 0,727 и 0,821 на автономных задачах, это разница между агентом, который закрывает диалог при первой ошибке, и агентом, который находит обходной путь и решает задачу клиента.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Т-Банк показал персонализацию нейросети Perseus: +10% к точности без истории покупок
ai

Т-Банк показал персонализацию нейросети Perseus: +10% к точности без истории покупок

Почему это важно Т-Банк открыто описал, как единая последовательность действий клиента из десятков сервисов поднимает точность рекомендаций на 3-17% даже там,…

6 мин
Три директора за полгода: центр ИИ при Трампе теряет руководителей быстрее, чем выпускает стандарты
ai

Три директора за полгода: центр ИИ при Трампе теряет руководителей быстрее, чем выпускает стандарты

Третий за год глава Центра стандартов ИИ при Белом доме ушёл с поста, и на этот раз причину даже не назвали: CAISI (Center for AI Standards and Innovation),…

5 мин
ИИ-агенты ломаются на пути в продакшен: четыре барьера, которые не видны на пилоте
ai

ИИ-агенты ломаются на пути в продакшен: четыре барьера, которые не видны на пилоте

Обнаружил, что оригинал обрывается на полуслове («Общая ви»). Пишу строго по тем фактам, которые есть в переданном тексте. ИИ-агенты (программы, которые сами…

6 мин