Как мультимодальность влияет на развитие ИИ-агентов: обвязка меняет результат в 1,5 раза
Мультимодальность меняет подход к оценке ИИ-агентов: исследователи из ByteDance, Georgia Tech и других команд предложили HarnessDev, бенчмарк, где модель оценивают не по ответу, а по качеству кода, который она пишет для собственной работы.

Впервые предметом оценки стал не результат модели, а инструментальная обвязка, которую она создаёт сама: цикл исполнения, инструменты, проверка, восстановление после ошибок. Для разработчиков, выбирающих между облачными сервисами, это прямой ориентир: одна и та же модель может показать разницу в полтора раза в зависимости от того, в какой «упаковке» она работает.
Исследование опубликовано командой из ByteDance Seed, Сингапурского университета технологий и дизайна (SUTD), Технологического института Джорджии (Georgia Tech), сообщества M-A-P и компании TokenWave.AI. Работа описана в научной статье и на странице проекта. HarnessDev переворачивает привычную логику бенчмарков: вместо того чтобы оценивать ответ модели при фиксированном окружении, он оценивает само окружение (harness, обвязку), которое модель написала с нуля.
| Параметр | Значение |
|---|---|
| Кто | ByteDance Seed, SUTD, Georgia Tech, M-A-P, TokenWave.AI |
| Что | HarnessDev, бенчмарк для оценки агентных обвязок |
| Тип | Исследовательский проект, открытая публикация |
| Модели-участники | Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max, Seed 2.0 Pro |
| Объём тестирования | 2 207 задач по 5 бенчмаркам, 4 домена |
Что такое «обвязка» и почему она решает?
Обвязка (agent harness) это код вокруг модели: цикл выполнения, подключённые инструменты, контекст, состояние, механизм восстановления после сбоев и проверка результатов. По данным таблицы лидеров Terminal-Bench 2.1, GPT-5 решает 35,2% задач внутри платформы Terminus 2, но 49,6% внутри Codex CLI при тех же весах модели. Разница только в обвязке.
Большинство бенчмарков фиксируют обвязку и меняют модель. HarnessDev делает наоборот: модель получает минимальный «каркас» без цикла, планировщика, верификатора и правил остановки. В таком виде каркас набирает 0 баллов. Модель должна сама написать полноценную обвязку, которая затем замораживается и тестируется на скрытых задачах.
Две стадии: создание и эволюция
На первой стадии (Creation) каждая модель-создатель получает одинаковый слабый каркас и спецификацию задач. Она строит обвязку, после чего код замораживается.
На второй стадии (Evolution) модель дорабатывает свой замороженный код, используя обратную связь от 100 задач SWE-bench Pro и 89 задач Terminal-Bench 2.1. Бюджет ограничен: 10 пар прогонов и не более 2 промежуточных проб между парами. Итоговая оценка проводится на 630 скрытых задачах, которые создатель никогда не видел.
Как конкретные модели справились с задачей?
Результаты при самооценке (Self-Eval, когда обвязку запускает та же модель, что её создала):
- Opus 4.8 показал лучший средний балл: 67,8 при эталоне 86,2 (обвязка, написанная людьми)
- Код: Opus 4.8 набрал 69,3 на SWE-Pro (эталон 80,0). Gemini 3.1 Pro лидировал на Terminal-Bench: 68,8 (эталон 88,8)
- Поиск: самый большой разрыв с эталоном. Лучший результат на BrowseComp: 52,6 у GPT-5.5 при эталоне 92,2
- Текст: Opus 4.8 набрал 84,6 на EQ-Bench3, обойдя эталон 83,7
- ML-эксперименты: Opus 4.8 (32,9) и Gemini (32,4) обошли эталон 24,0
Факт, критичный для понимания, как мультимодальность влияет на развитие ИИ-агентов: объём написанного кода не предсказывает качество. 18 обвязок добавили 17 111 строк, но Gemini добавил меньше всех (1 006 строк) и при этом лидировал на Terminal-Bench.
DeepSeek и Qwen: что показали модели, доступные в России?
Для разработчиков из РФ и СНГ, выбирающих между облачными сервисами, ключевые данные по двум моделям с открытым доступом:
- DeepSeek V4 Pro на MLE-bench показал медальный рейтинг 19,6, почти идентичный GPT-5.5 (19,1), но потратил при этом 208,4 млн токенов (единица текста, которую обрабатывает модель) против 29,3 млн у GPT-5.5. Разница в стоимости инференса (вычислений при генерации ответа) примерно в 7 раз
- Qwen 3.7 Max при смене исполнителя на Gemini прибавил 17,6 балла на BrowseComp и 12,9 на MLE-bench. Это означает, что обвязка Qwen оказалась более универсальной и менее привязанной к конкретному исполнителю
Для сравнения: Opus 4.8 при смене исполнителя с собственного на Gemini упал с 69,3 до 33,0 на SWE-Pro. Одна из причин: обвязка жёстко ограничивала количество шагов (120) под конкретный исполнитель. Доля дублирующих запросов при поиске подскочила с 10,1% до 88,2%.
Эволюция работает, но еле-еле
Все 5 моделей при самостоятельном исполнении улучшили результаты на скрытых задачах: от +1,43 до +4,44 балла (среднее +3,11). Но прогресс не был линейным: из 64 переключений между версиями 8 ухудшили оба бенчмарка, 16 ухудшили один, 27 дали прирост в пределах шума. Только 2 из 64 показали явное улучшение.
Обратная связь и результаты на скрытых задачах совпадали по направлению лишь в 53,1% случаев (34 из 64). Только 2 из 9 финальных версий оказались оптимальными на скрытых данных.
Большая часть сгенерированного кода оказалась «мёртвой»: из 108 компонентов 18 ни разу не сработали (все относятся к состоянию и памяти). Ни одно событие контрольной точки не появилось в 26 679 траекториях выполнения. 124 из 587 текстовых функций никогда не вызывались.
Самый яркий успех эволюции: Opus 4.8 обнаружил, что 99 из 100 прогонов сообщали об успехе, хотя прошли только 48, отследил причину (преждевременное завершение) и добавил проверку завершённости. : Из статьи HarnessDev
Бенчмарк показал: качество ИИ-инструмента зависит не только от «ума» модели, но и от кода, который соединяет модель с задачей. Для автора это значит, что два сервиса на одной модели могут давать совершенно разные результаты. Выбирать стоит не по названию модели внутри, а по качеству конечного продукта в вашей конкретной задаче.
Что это значит для вас?
Авторам Дзена и копирайтерам. Если вы используете ИИ-ассистенты для текстов, запомните факт из исследования: на задачах написания текстов (EQ-Bench3) модели уже обходят человеческий эталон. Но на задачах поиска информации отстают почти вдвое. Перепроверяйте факты, которые ИИ находит сам.
Разработчикам в РФ и СНГ. DeepSeek V4 Pro показал результат на уровне GPT-5.5 по качеству, но обошёлся в 7 раз дороже по токенам. Qwen 3.7 Max оказался самым «переносимым» между исполнителями. Если вы строите агентные (работающие автономно) системы и ограничены в бюджете, Qwen заслуживает тестирования первым.
Предпринимателям. Исследование показывает, как мультимодальность влияет на развитие ИИ-агентов на практике: модель, которая умеет работать с кодом, текстом, поиском и ML-экспериментами одновременно, строит более качественные обвязки. Но «более качественные» не значит «универсальные»: обвязка Opus, лучшая в своём окружении, потеряла больше половины результата при смене исполнителя.
По моим наблюдениям, это исследование фиксирует неочевидную вещь: мы привыкли сравнивать модели, а сравнивать нужно системы. Один и тот же GPT-5 в разных обвязках показывает разницу в 14 процентных пунктов. Для практика это означает, что выбор инструмента (Cursor, Claude Code, Codex CLI или что-то ещё) может быть важнее выбора модели внутри. Из доступных в РФ аналогов стоит обратить внимание на связки с DeepSeek и Qwen: результаты конкурентоспособны, а доступ стабильнее. Оговорка: все цифры получены на исследовательских бенчмарках. Реальные задачи автора или разработчика могут отличаться. Попробуйте дать одну и ту же задачу двум разным инструментам на одной модели и сравните сами.
Главный практический вывод: не гонитесь за названием модели, тестируйте конечный инструмент на своих задачах, потому что код между вами и моделью решает не меньше, чем сама модель.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Anthropic раскрыла 5 случаев обхода защиты Claude AI: безопасность проверили биооружием
Anthropic, разработчик Claude, второго июня 2025 года впервые раскрыла конкретные случаи, когда исследователи из запрещённых стран пытались использовать модель…

Агенты OpenAI взломали RubyGems
Независимые расследователи обнаружили, что ИИ-агенты OpenAI в мае 2025 года атаковали RubyGems, репозиторий пакетов для языка программирования Ruby, загрузив…
Исследователь Anthropic уволился, глава безопасности его поддержал: опасность ИИ признали изнутри
Исследователь Anthropic, одной из крупнейших компаний в сфере ИИ, уволился на этой неделе и публично заявил, что компания «мчится к самосовершенствующемуся…
Комментарии