Google учит ИИ-агентов на старых средах: EnvHarness поднимает результат до +9 пунктов
Google создал специальную обёртку EnvHarness, которая превращает статичные тренировочные среды для ИИ-агентов в адаптивные, подстраивающиеся под слабости конкретной модели, и при этом не требует генерации новых сред с нуля.

Сейчас среды для тренировки ИИ-агентов (интерактивные «песочницы», где агент учится действовать) одноразовые: как только агент их освоил, учиться больше нечему. EnvHarness позволяет переиспользовать уже готовые среды, меняя условия задач без переписывания кода, а результат на новых задачах вырастает до 9 пунктов.
Команда исследователей из Google Cloud AI Research, Вашингтонского университета в Сент-Луисе и Университета Северной Каролины в Чапел-Хилле опубликовала EnvHarness как решение фундаментальной проблемы: ИИ-агенты всё чаще учатся не на текстах, а в интерактивных средах, но эти среды «замораживаются» после создания и перестают учить агента чему-то новому. Обычный выход, генерировать новые среды, но это дорого и привязано к конкретной области. EnvHarness предлагает обратный подход.
| Показатель | Значение | Источник |
|---|---|---|
| Прирост на новых задачах (ALFWorld, OOD) | +9,0 пунктов | статья EnvHarness |
| Сокращение шагов выполнения (SWE-bench Verified) | 9,8% | статья EnvHarness |
| Resolved rate на SWE-bench Verified | с 49,88% до 52,58% | статья EnvHarness |
| Преимущество над SWE-smith | +2,46 пункта при 5,11 меньше шагов | статья EnvHarness |
| Покрытие целевого диапазона сложности задач | с 6% до 80% | статья EnvHarness |
| Лицензия | Apache 2.0 | GitHub-репозиторий |
Как работает обёртка вместо генератора?
Представьте, что у вас есть тренажёр для водителя. Обычный подход: каждый раз строить новый город с новыми дорогами, когда ученик освоил маршрут. EnvHarness действует иначе: берёт тот же город, но меняет стартовую точку, перекрывает часть улиц или добавляет второй маршрут в ту же поездку. Тренажёр внутри тот же, проверка результата та же, но задача для ученика другая.
Технически EnvHarness оборачивает существующую среду через стандартный интерфейс (два метода: «сброс» и «шаг»), не затрагивая ни код среды, ни систему проверки результатов, которую писали люди. Это принципиально: проверка остаётся человеческой, а не сгенерированной другой нейросетью.
Три компонента меняют задачу, не ломая среду
EnvHarness включает три модуля, которые можно комбинировать:
- Stage (стартовая позиция): прокручивает заданный набор действий после запуска, так что агент начинает не с начала, а из середины ситуации. Например, целевой предмет уже спрятан в закрытом ящике, и агенту нужно искать, а не просто брать.
- Contract (правила взаимодействия): устанавливает ограничения на каждом шаге. Можно заблокировать определённое действие, переписать ответ среды или обрезать наблюдение, видимое агенту.
- Chain (цепочка сред): встраивает вторую среду в тот же эпизод с общим бюджетом шагов. Агент проходит задачу, только если решит обе части.
Кто подбирает компоненты?
Сами компоненты нейтральны к конкретному агенту. Но выбирать, какие именно обёртки применить, должен кто-то, кто видит слабости модели. Эту роль выполняет EnvRigger, отдельный модуль-диагност.
EnvRigger работает в четыре этапа: наблюдает пять пробных прогонов агента, находит системную ошибку, пишет компоненты-обёртки на Python и проверяет результат на пяти свежих прогонах. Задачи, которые оказываются нерешаемыми или тривиальными, отбраковываются. На каждую задачу даётся до пяти попыток доработки. Сгенерированный код запускается в изолированном процессе, поэтому ошибка в обёртке не ломает весь запуск, а становится записанным логом.
Результаты на пяти бенчмарках подтвердили рост
Авторы проверили подход на пяти тестах в четырёх областях: ALFWorld (домашние задачи), WebArena (веб-навигация), SWE-bench Verified (исправление кода), OfficeQA и SpreadsheetBench (офисные задачи).
Ключевые находки:
- На ALFWorld средний результат вырос с 62,4 до 68,3, а на задачах вне обучающей выборки прибавка составила 9,0 пунктов.
- На SWE-bench Verified доля решённых задач поднялась с 49,88% до 52,58%, а среднее число шагов сократилось с 55,01 до 49,61, то есть на 9,8%.
- На SpreadsheetBench и WebArena навыки, добытые из неизменённых сред, оказались хуже, чем работа вообще без навыков. Именно изменение среды сделало добычу навыков осмысленной.
- При обучении с подкреплением (GRPO, обучение методом групповых предпочтений) на модели Qwen3-8B-base результат на ALFWorld вырос с 81,4 до 87,9, хотя на задачах вне выборки наблюдалось небольшое снижение (с 89,6 до 88,8).
- При масштабировании до 300 сред результат достиг 54,79 против 52,13 у оригинальных и 50,37 у сгенерированных сред.
Все цифры получены на английских бенчмарках с англоязычными задачами. Авторы не тестировали EnvHarness на русскоязычных средах и сайтах. Прирост 9,0 пунктов на ALFWorld измерен на задачах вне обучающей выборки, но сам ALFWorld это синтетическая «домашняя» среда, а не реальный продукт. Обязательное условие: среда должна поддерживать сброс состояния, поэтому живые пользовательские аккаунты и физические роботы не подходят.
Что с этого вам?
Автору Дзена и копирайтеру. Если вы экспериментируете с ИИ-агентами для автоматизации рутины (сбор данных с сайтов, работа с таблицами), EnvHarness показывает принцип, который можно перенести на свои задачи: не строить новый тестовый набор каждый раз, а менять условия в уже готовом. Для русскоязычных веб-агентов это означает, что один набор тестовых русских сайтов можно переиспользовать, меняя стартовые состояния и ограничения.
Маркетологу. Идея «обёртки поверх среды» снижает стоимость обучения ИИ-агентов. Вместо заказа генерации новых тестовых сценариев для каждого продукта можно обернуть существующие. Пока это лабораторный результат, но он сигнализирует о том, что цена «умных» агентов для бизнеса будет падать.
Предпринимателю в РФ и СНГ. Код открыт под лицензией Apache 2.0, доступен на GitHub. Если ваша команда уже запускает агентные циклы (например, ИИ-агенты для офисных задач или тестирования кода), EnvHarness можно подключить: новый бенчмарк добавляется реализацией одного интерфейса. Для русскоязычных офисных сценариев (OfficeQA, таблицы) потребуется адаптация тестов, но сам механизм обёртки не зависит от языка.
Мне кажется, самое ценное в EnvHarness не цифры прироста, а сам принцип: не генерируй новое, а оберни старое. Это ровно тот подход, который экономит деньги на практике. Для тех, кто в России строит ИИ-агентов для веб-навигации или офисной автоматизации, барьер входа невысокий: код открыт, интерфейс стандартный. Но честно скажу: на русскоязычных задачах никто пока не проверял, и первые, кто это сделает, получат фору.
Если вы уже запускаете ИИ-агентов в рабочих сценариях, попробуйте применить логику EnvHarness к своим тестам: не выбрасывайте отработанные среды, а поменяйте стартовые условия и ограничения. Код на GitHub готов к экспериментам, а отсутствие русскоязычных результатов это не преграда, а открытая ниша.
По данным статьи EnvHarness (arXiv)

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Разработчик на Rust нашёл баг в Neural Engine Apple, который пропустил Claude Opus
Компания Apple не выпускала Neural Engine как новый продукт: речь о глубоком техническом разборе уже существующего аппаратного блока, который провёл…

Markdown редактор MarkMello v0.4.0: папки, вкладки и поиск без потери скорости
Почему это важно Markdown-редактор MarkMello остался таким же быстрым при открытии одного файла, но теперь умеет работать с папками, вкладками и поиском, и всё…

Фреймворк ICO собирает пайплайн машинного обучения в единый граф без «швов»
Компания PyTorch и её экосистема давно стали стандартом для инженеров, занимающихся машинным обучением, но типичный пайплайн обучения модели по-прежнему…
Комментарии