Игорь Градов
Игорь Градов
5 мин
ai

Что такое ИИ-агент, который учится сам: фреймворк Microsoft поднял точность кода на 14,6 п.п.

Microsoft Research Asia представила Agent Lightning v1.0, открытый фреймворк для обучения ИИ-агентов методом обучения с подкреплением, который позволяет тренировать агента прямо в его рабочей среде, без переписывания кода под учебный стенд.

Что такое ИИ-агент, который учится сам: фреймворк Microsoft поднял точность кода на 14,6 п.п.
Почему это важно

До сих пор, чтобы дообучить ИИ-агента (программу, которая сама выполняет задачи: пишет код, ищет информацию, управляет процессами), разработчику приходилось воссоздавать всю логику агента внутри обучающего фреймворка. Agent Lightning убирает этот этап: агент учится в том же виде, в каком потом работает.

Исследователи из Microsoft Research Asia опубликовали фреймворк и формально описали подход, который назвали Harnessed Agentic RL. Суть: обучение с подкреплением (RL, reinforcement learning, метод, при котором ИИ учится методом проб и ошибок, получая награды за верные действия) встраивается в уже существующую обвязку агента. Раньше такие системы, как verl, AReaL и slime, требовали полной пересборки агента внутри тренировочной среды. Agent Lightning вместо этого ставит прокси-сервер между агентом и языковой моделью и записывает все обращения, не меняя ни строчки в коде самого агента.

Показатель Значение Источник
Объём кода фреймворка около 3 500 строк Microsoft Research Asia
Результат до обучения (Pass@1, SWE-bench Verified) 41,8% Microsoft Research Asia
Результат после обучения 56,4% Microsoft Research Asia
Прирост 14,6 процентных пунктов Microsoft Research Asia
Обучающая выборка около 6 000 примеров (открытый датасет) Microsoft Research Asia
Базовая модель Qwen3.5-9B Microsoft Research Asia

Что именно измеряли?

Команда проверяла, можно ли обучить полноценного ИИ-агента для написания кода, не пересобирая его логику под учебную платформу. Бенчмарк SWE-bench Verified, это набор реальных задач из открытых репозиториев: агент получает описание бага и должен сам найти нужный файл, написать исправление и пройти тесты.

Модель Qwen3.5-9B (открытая модель с 9 миллиардами параметров) сначала прогнали по бенчмарку без дообучения, затем обучили через Agent Lightning на выборке из примерно 6 000 примеров и замерили снова.

Важная деталь: агент во время обучения работал точно так же, как при реальном использовании. Фреймворк не подменял его внутренности, а только наблюдал за обменом запросами между агентом и моделью через LLM-прокси (промежуточный сервер, который перехватывает и записывает все вызовы к языковой модели).

Что обнаружили?

  • Прирост качества 14,6 процентных пунктов на SWE-bench Verified (с 41,8% до 56,4%) при обучении всего на 6 000 примерах. Для сравнения, многие конкурирующие подходы используют на порядок больше данных.
  • Код агента не менялся. Достаточно перенаправить вызовы модели на прокси Agent Lightning, и фреймворк сам собирает траектории обучения.
  • Kubernetes без облачных сервисов. Kubernetes (система оркестрации контейнеров, фактически диспетчер, который распределяет задачи по серверам) поддерживается нативно: агенты запускаются как стандартные задачи на собственных кластерах, в облаке или на локальной машине. Платные песочницы не нужны.
  • Компактность. Весь фреймворк уместился в 3 500 строк кода, три компонента: шлюз API, контроллер прогонов и кастомизированный тренер.

Исследователи также описали четыре технические проблемы, которые возникают, когда обучающая система не управляет циклом взаимодействия напрямую: ретокенизация (повторное разбиение текста на токены может сдвинуть границы), расчёт преимущества, нормализация потерь и планирование нагрузки на GPU. В Agent Lightning v1.0 для каждой из этих задач предложено решение.

Как это читать

Результат получен на одной модели (Qwen3.5-9B) и одном бенчмарке (SWE-bench Verified). Как фреймворк покажет себя на других задачах и моделях, пока не проверено. Выборка в 6 000 примеров взята из открытого датасета, но авторы не уточняют, насколько она репрезентативна для задач за пределами исправления багов. Фреймворк открыт, однако воспроизведение требует инфраструктуры с GPU и навыков работы с Kubernetes.

Что это значит для вас?

Разработчику в России и СНГ. Главная практическая ценность: можно взять своего ИИ-агента, не переписывая его под учебный стенд, и дообучить методом RL на собственных серверах. Kubernetes работает на любой инфраструктуре, облачные песочницы не нужны. Код открыт, 3 500 строк, это объём, который один инженер может прочитать за день.

Автору Дзена и контент-специалисту. Сейчас всё чаще звучит вопрос, что такое ИИ-агент и чем он отличается от обычного чат-бота. Agent Lightning показывает направление: агент, это не просто модель, а целая система из модели, инструментов и среды выполнения. Понимание этой разницы помогает точнее писать о технологиях и выбирать инструменты для автоматизации рутины.

Предпринимателю. Если вы рассматриваете внедрение ИИ-агентов для автоматизации кодирования или тестирования, Agent Lightning снижает порог входа: не нужно покупать доступ к коммерческим песочницам, а дообучение на 6 000 примерах выглядит экономичнее, чем подходы с десятками тысяч.

Мнение редакции dzen.guru

По моим наблюдениям, главная боль при работе с ИИ-агентами в России, это разрыв между тем, как агент ведёт себя на тестовом стенде, и тем, как он работает в продакшене. Agent Lightning бьёт именно в эту точку: агент тренируется в своей рабочей обвязке, а не в лабораторной копии. Для команд, которые уже используют Kubernetes на своих серверах (а таких в РФ немало после ухода части облачных провайдеров), это реально рабочий вариант. 3 500 строк кода, это не маркетинговая цифра, а приглашение: форкни, разберись, допили под себя. Я рекомендую тем, кто строит агентов на открытых моделях, посмотреть репозиторий и попробовать прогнать пайплайн на своих задачах.

Если вы давно хотели понять, что такое ИИ-агент на практике, а не в теории, Agent Lightning, это хороший повод: открытый код, воспроизводимый пайплайн и результат, который можно проверить на своих данных за выходные.

По данным Microsoft Research Asia

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ChatGPT получил интерфейс с кнопками и калькуляторами: чат стал мини-приложением
ai

ChatGPT получил интерфейс с кнопками и калькуляторами: чат стал мини-приложением

ChatGPT второго июля запустил режим Intelligent UI, который превращает текстовый чат в визуальный интерфейс с интерактивными графиками, калькуляторами и…

5 мин
ai

Искусственный интеллект в доставке: стартап из 10 человек забрал у DoorDash 65% заказов

Компания DoorDash, обработавшая 970 миллионов заказов за второй квартал 2025 года, разослала ресторанам предупреждения о стартапе Bites, и этот конфликт…

6 мин
AI-агенты на практике: 80% работы уходит не в ядро, а в обвязку
ai

AI-агенты на практике: 80% работы уходит не в ядро, а в обвязку

Продолжу обработку оригинала и напишу новость. Спокойная экспертная подача ИИ-агентов через реальные архитектурные разборы для широкой аудитории: авторы,…

5 мин