Игорь Градов
Игорь Градов
5 мин
ai

Что такое ИИ-агент и как Microsoft учит его в синтетических мирах: с 36,5% до 67,1%

Microsoft выпустила Echoverse, набор из двенадцати синтетических тренировочных миров для ИИ-агентов (программ, которые сами выполняют задачи на компьютере), и модель размером 9 миллиардов параметров почти удвоила результат, поднявшись с 36,5% до 67,1%.

Что такое ИИ-агент и как Microsoft учит его в синтетических мирах: с 36,5% до 67,1%
Почему это важно

ИИ-агенты учатся действовать не на скриншотах, а в полноценных копиях реальных приложений, и открытый код Echoverse позволяет любому разработчику воспроизвести этот подход у себя.

Чтобы понять, что такое ИИ-агент в контексте Echoverse, нужен короткий контекст. Агент управляет компьютером сам: кликает, заполняет формы, переключает экраны. Но тренировать его на живых сервисах нельзя: каждое действие пишет в реальный аккаунт, нет кнопки «сброс», а внутреннее состояние скрыто за интерфейсом. Microsoft решила проблему иначе: вместо живых сайтов построила синтетические миры, полные копии приложений с собственной базой данных, которые можно ломать, сбрасывать и проверять по реальному состоянию, а не по картинке на экране.

Что понадобится

  • Аккаунт на GitHub для доступа к репозиторию microsoft/Echoverse (четыре мира из двенадцати опубликованы с кодом, данными и верификаторами).
  • Аккаунт на Hugging Face для загрузки датасетов (microsoft/Echoverse).
  • Базовое понимание Python и Docker для развёртывания синтетических окружений локально.
  • GPU-сервер или облачный инстанс с поддержкой моделей от 9 миллиардов параметров (для дообучения, то есть обучения модели на конкретных примерах под узкую задачу).
  • Время: от 2 до 4 часов на первый запуск и знакомство с одним миром, от нескольких дней на полный цикл дообучения.

Как запустить тренировку ИИ-агента на Echoverse?

  1. Клонируйте репозиторий. Откройте терминал и выполните:
git clone https://github.com/microsoft/Echoverse.git
cd Echoverse
  1. Установите зависимости. Следуйте инструкции в README: там указаны версии Python, необходимые библиотеки и Docker-образы для запуска синтетических приложений.

  2. Выберите мир для тренировки. Echoverse содержит два типа миров:

  3. Десять «доменных» миров, копии реальных приложений (почта, чат, календарь, облачные консоли) с полноценным поведением: отправленное сообщение появляется у получателя, отменённая встреча исчезает из обоих календарей.
  4. Два «навыковых» мира, тренажёры конкретных элементов интерфейса (выбор дат, вложенные фильтры), которые агенты чаще всего не могут освоить.

  5. Запустите базовую модель и получите начальный результат. Прогоните агента по задачам выбранного мира. Верификатор (grounded verifier, то есть проверка по реальному состоянию базы данных, а не по скриншоту) покажет процент успешных выполнений.

  6. Запустите цикл дообучения. Ключевой принцип Echoverse называется «совместная эволюция» (co-evolution): вы не просто обучаете модель, а одновременно улучшаете мир, задачи и верификатор. Цикл выглядит так:

  7. Агент действует в мире.
  8. Верификатор фиксирует, где агент ошибся.
  9. Вы усложняете задачи или повышаете точность мира в слабых местах.
  10. Модель обучается на более точном сигнале.
  11. Повторяете.

  12. Примените обучение с подкреплением (RL). По данным технического отчёта Microsoft, именно этап RL поднимает результат выше уровня простого подражания: агент учится достигать цели за меньшее число шагов.

Что ввели и что получили

Команда Microsoft взяла модель размером 9 миллиардов параметров и прогнала её через все двенадцать миров. Начальный результат составил 36,5%. После полного цикла дообучения и обучения с подкреплением результат вырос до 67,1%. Для сравнения: по данным того же технического отчёта, это в пределах 14 процентных пунктов от результата GPT-5.4. Модель, которая в сотни раз меньше, подобралась к уровню флагмана благодаря качеству тренировочной среды, а не размеру.

Почему глубина мира важнее количества?

Главный вывод исследования: «мелкие» миры (shallow worlds), которые воспроизводят только внешний вид интерфейса, вредят агенту. Модель, обученная на упрощённых копиях сайтов, показала регресс по сравнению с базовым уровнем. На «глубоких» копиях, где сохраняется причинно-следственная связь между действиями, результат рос.

Microsoft выделяет пять свойств «глубокого» мира:

  • Поведенческая точность: кнопки, права доступа и ошибки работают как в реальном продукте.
  • Согласованное состояние: действие одного пользователя отражается у другого.
  • Глубина сценариев: ранний выбор ограничивает следующие шаги.
  • Проверка по данным, а не по пикселям.
  • Ценность домена: сценарий воспроизводит работу, которую действительно хотят автоматизировать.

Что делать с этим по ролям?

Разработчику ИИ-агентов. Четыре мира с кодом и верификаторами уже открыты на GitHub. Можно начать эксперименты, не собирая инфраструктуру с нуля. Если вы строите агента для работы с интерфейсами, Echoverse даёт готовый полигон.

Автору на Дзене. Понимание того, что такое ИИ-агент и как он обучается, помогает писать точнее. Агент не «думает», он отрабатывает последствия действий в среде. Это конкретика для статей, которая отличает экспертный контент от поверхностного.

Предпринимателю в РФ и СНГ. Echoverse показывает, что качественная среда для тренировки может компенсировать размер модели. Если вы выбираете между дорогой закрытой моделью и компактной открытой, исследование Microsoft аргументирует второй путь. Из доступных в РФ моделей для агентных задач стоит смотреть на YandexGPT и GigaChat, хотя аналогов Echoverse для тренировки агентов в российском опенсорсе пока нет.

Частые ошибки

Тренировка на «мелких» мирах. Если среда показывает только внешний вид страницы, но не сохраняет состояние между экранами, агент выучит нажимать кнопки, но не поймёт последствий. По данным отчёта Microsoft, это приводит к регрессу.

Оценка по скриншоту. Верификатор, который сравнивает картинки, не увидит, что данные в базе не изменились. Echoverse проверяет результат по состоянию базы данных.

Игнорирование навыковых миров. Два мира Echoverse построены вокруг элементов, на которых агенты ошибаются чаще всего: выбор дат (date pickers) и вложенные фильтры (nested filters). Пропустить их значит оставить самые частые провалы без тренировки.

Ожидание мгновенного результата. Цикл «совместной эволюции» требует нескольких итераций. Один прогон дообучения не даст скачка с 36% до 67%.

Мнение редакции dzen.guru

Echoverse подтверждает тезис, который мы в dzen.guru наблюдаем на практике: качество данных и среды важнее количества параметров. Модель в 9 миллиардов параметров, обученная в правильных условиях, подбирается к GPT-5.4. Для тех, кто работает с ИИ-агентами в России, это практический аргумент: не гонитесь за самой большой моделью, стройте качественную среду для тренировки. Честная оговорка: открыты только четыре мира из двенадцати, а для воспроизведения полного результата потребуется серьёзная GPU-инфраструктура, которая стоит денег.

Научитесь работать с ИИ-агентами на практике

В dzen.guru мы разбираем инструменты и подходы, которые реально работают для авторов и предпринимателей в РФ

Попробовать dzen.guru

Открытие четырёх миров Echoverse с кодом и верификаторами на GitHub даёт разработчикам конкретный инструмент, а не очередной бенчмарк. Кто первым построит «глубокие» тренировочные среды для своих задач, тот получит агентов, которые реально работают, а не красиво выглядят на демо.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Anthropic отстояла ограничения ИИ в суде: Пентагон не доказал право на отключение

Anthropic выиграла ключевой раунд в суде: 5 июня судья заявила, что администрация Трампа не доказала право отключить компанию от госконтрактов за отказ…

4 мин
ai

Anthropic перевела MCP протокол на безсессионную архитектуру: ИИ-интеграции теперь масштабируются

Компания Anthropic выпустила крупнейшее обновление MCP протокола (Model Context Protocol, открытый стандарт взаимодействия ИИ-систем с внешними инструментами и…

5 мин
Google DeepMind учит нейросети на лету: EvoLib обходится без разметки и машинного обучения в классическом виде
ai

Google DeepMind учит нейросети на лету: EvoLib обходится без разметки и машинного обучения в классическом виде

Архетектура новости для H1 «Эволюционное обучение нейросетей и машинное обучение» — строю по плану. Google DeepMind представила EvoLib, фреймворк, который…

6 мин