Игорь Градов
Игорь Градов
5 мин
ai

Google учит ИИ-агентов на старых средах: EnvHarness поднимает результат до +9 пунктов

Google создал специальную обёртку EnvHarness, которая превращает статичные тренировочные среды для ИИ-агентов в адаптивные, подстраивающиеся под слабости конкретной модели, и при этом не требует генерации новых сред с нуля.

Google учит ИИ-агентов на старых средах: EnvHarness поднимает результат до +9 пунктов
Почему это важно

Сейчас среды для тренировки ИИ-агентов (интерактивные «песочницы», где агент учится действовать) одноразовые: как только агент их освоил, учиться больше нечему. EnvHarness позволяет переиспользовать уже готовые среды, меняя условия задач без переписывания кода, а результат на новых задачах вырастает до 9 пунктов.

Команда исследователей из Google Cloud AI Research, Вашингтонского университета в Сент-Луисе и Университета Северной Каролины в Чапел-Хилле опубликовала EnvHarness как решение фундаментальной проблемы: ИИ-агенты всё чаще учатся не на текстах, а в интерактивных средах, но эти среды «замораживаются» после создания и перестают учить агента чему-то новому. Обычный выход, генерировать новые среды, но это дорого и привязано к конкретной области. EnvHarness предлагает обратный подход.

Показатель Значение Источник
Прирост на новых задачах (ALFWorld, OOD) +9,0 пунктов статья EnvHarness
Сокращение шагов выполнения (SWE-bench Verified) 9,8% статья EnvHarness
Resolved rate на SWE-bench Verified с 49,88% до 52,58% статья EnvHarness
Преимущество над SWE-smith +2,46 пункта при 5,11 меньше шагов статья EnvHarness
Покрытие целевого диапазона сложности задач с 6% до 80% статья EnvHarness
Лицензия Apache 2.0 GitHub-репозиторий

Как работает обёртка вместо генератора?

Представьте, что у вас есть тренажёр для водителя. Обычный подход: каждый раз строить новый город с новыми дорогами, когда ученик освоил маршрут. EnvHarness действует иначе: берёт тот же город, но меняет стартовую точку, перекрывает часть улиц или добавляет второй маршрут в ту же поездку. Тренажёр внутри тот же, проверка результата та же, но задача для ученика другая.

Технически EnvHarness оборачивает существующую среду через стандартный интерфейс (два метода: «сброс» и «шаг»), не затрагивая ни код среды, ни систему проверки результатов, которую писали люди. Это принципиально: проверка остаётся человеческой, а не сгенерированной другой нейросетью.

Три компонента меняют задачу, не ломая среду

EnvHarness включает три модуля, которые можно комбинировать:

  • Stage (стартовая позиция): прокручивает заданный набор действий после запуска, так что агент начинает не с начала, а из середины ситуации. Например, целевой предмет уже спрятан в закрытом ящике, и агенту нужно искать, а не просто брать.
  • Contract (правила взаимодействия): устанавливает ограничения на каждом шаге. Можно заблокировать определённое действие, переписать ответ среды или обрезать наблюдение, видимое агенту.
  • Chain (цепочка сред): встраивает вторую среду в тот же эпизод с общим бюджетом шагов. Агент проходит задачу, только если решит обе части.

Кто подбирает компоненты?

Сами компоненты нейтральны к конкретному агенту. Но выбирать, какие именно обёртки применить, должен кто-то, кто видит слабости модели. Эту роль выполняет EnvRigger, отдельный модуль-диагност.

EnvRigger работает в четыре этапа: наблюдает пять пробных прогонов агента, находит системную ошибку, пишет компоненты-обёртки на Python и проверяет результат на пяти свежих прогонах. Задачи, которые оказываются нерешаемыми или тривиальными, отбраковываются. На каждую задачу даётся до пяти попыток доработки. Сгенерированный код запускается в изолированном процессе, поэтому ошибка в обёртке не ломает весь запуск, а становится записанным логом.

Результаты на пяти бенчмарках подтвердили рост

Авторы проверили подход на пяти тестах в четырёх областях: ALFWorld (домашние задачи), WebArena (веб-навигация), SWE-bench Verified (исправление кода), OfficeQA и SpreadsheetBench (офисные задачи).

Ключевые находки:

  • На ALFWorld средний результат вырос с 62,4 до 68,3, а на задачах вне обучающей выборки прибавка составила 9,0 пунктов.
  • На SWE-bench Verified доля решённых задач поднялась с 49,88% до 52,58%, а среднее число шагов сократилось с 55,01 до 49,61, то есть на 9,8%.
  • На SpreadsheetBench и WebArena навыки, добытые из неизменённых сред, оказались хуже, чем работа вообще без навыков. Именно изменение среды сделало добычу навыков осмысленной.
  • При обучении с подкреплением (GRPO, обучение методом групповых предпочтений) на модели Qwen3-8B-base результат на ALFWorld вырос с 81,4 до 87,9, хотя на задачах вне выборки наблюдалось небольшое снижение (с 89,6 до 88,8).
  • При масштабировании до 300 сред результат достиг 54,79 против 52,13 у оригинальных и 50,37 у сгенерированных сред.
Как это читать

Все цифры получены на английских бенчмарках с англоязычными задачами. Авторы не тестировали EnvHarness на русскоязычных средах и сайтах. Прирост 9,0 пунктов на ALFWorld измерен на задачах вне обучающей выборки, но сам ALFWorld это синтетическая «домашняя» среда, а не реальный продукт. Обязательное условие: среда должна поддерживать сброс состояния, поэтому живые пользовательские аккаунты и физические роботы не подходят.

Что с этого вам?

Автору Дзена и копирайтеру. Если вы экспериментируете с ИИ-агентами для автоматизации рутины (сбор данных с сайтов, работа с таблицами), EnvHarness показывает принцип, который можно перенести на свои задачи: не строить новый тестовый набор каждый раз, а менять условия в уже готовом. Для русскоязычных веб-агентов это означает, что один набор тестовых русских сайтов можно переиспользовать, меняя стартовые состояния и ограничения.

Маркетологу. Идея «обёртки поверх среды» снижает стоимость обучения ИИ-агентов. Вместо заказа генерации новых тестовых сценариев для каждого продукта можно обернуть существующие. Пока это лабораторный результат, но он сигнализирует о том, что цена «умных» агентов для бизнеса будет падать.

Предпринимателю в РФ и СНГ. Код открыт под лицензией Apache 2.0, доступен на GitHub. Если ваша команда уже запускает агентные циклы (например, ИИ-агенты для офисных задач или тестирования кода), EnvHarness можно подключить: новый бенчмарк добавляется реализацией одного интерфейса. Для русскоязычных офисных сценариев (OfficeQA, таблицы) потребуется адаптация тестов, но сам механизм обёртки не зависит от языка.

Мнение редакции dzen.guru

Мне кажется, самое ценное в EnvHarness не цифры прироста, а сам принцип: не генерируй новое, а оберни старое. Это ровно тот подход, который экономит деньги на практике. Для тех, кто в России строит ИИ-агентов для веб-навигации или офисной автоматизации, барьер входа невысокий: код открыт, интерфейс стандартный. Но честно скажу: на русскоязычных задачах никто пока не проверял, и первые, кто это сделает, получат фору.

Если вы уже запускаете ИИ-агентов в рабочих сценариях, попробуйте применить логику EnvHarness к своим тестам: не выбрасывайте отработанные среды, а поменяйте стартовые условия и ограничения. Код на GitHub готов к экспериментам, а отсутствие русскоязычных результатов это не преграда, а открытая ниша.

По данным статьи EnvHarness (arXiv)

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Разработчик на Rust нашёл баг в Neural Engine Apple, который пропустил Claude Opus
ai

Разработчик на Rust нашёл баг в Neural Engine Apple, который пропустил Claude Opus

Компания Apple не выпускала Neural Engine как новый продукт: речь о глубоком техническом разборе уже существующего аппаратного блока, который провёл…

6 мин
Markdown редактор MarkMello v0.4.0: папки, вкладки и поиск без потери скорости
ai

Markdown редактор MarkMello v0.4.0: папки, вкладки и поиск без потери скорости

Почему это важно Markdown-редактор MarkMello остался таким же быстрым при открытии одного файла, но теперь умеет работать с папками, вкладками и поиском, и всё…

5 мин
Фреймворк ICO собирает пайплайн машинного обучения в единый граф без «швов»
ai

Фреймворк ICO собирает пайплайн машинного обучения в единый граф без «швов»

Компания PyTorch и её экосистема давно стали стандартом для инженеров, занимающихся машинным обучением, но типичный пайплайн обучения модели по-прежнему…

6 мин