Игорь Градов
Игорь Градов
6 мин
ai

Как мультимодальность влияет на развитие ИИ-агентов: обвязка меняет результат в 1,5 раза

Мультимодальность меняет подход к оценке ИИ-агентов: исследователи из ByteDance, Georgia Tech и других команд предложили HarnessDev, бенчмарк, где модель оценивают не по ответу, а по качеству кода, который она пишет для собственной работы.

Как мультимодальность влияет на развитие ИИ-агентов: обвязка меняет результат в 1,5 раза
Почему это важно

Впервые предметом оценки стал не результат модели, а инструментальная обвязка, которую она создаёт сама: цикл исполнения, инструменты, проверка, восстановление после ошибок. Для разработчиков, выбирающих между облачными сервисами, это прямой ориентир: одна и та же модель может показать разницу в полтора раза в зависимости от того, в какой «упаковке» она работает.

Исследование опубликовано командой из ByteDance Seed, Сингапурского университета технологий и дизайна (SUTD), Технологического института Джорджии (Georgia Tech), сообщества M-A-P и компании TokenWave.AI. Работа описана в научной статье и на странице проекта. HarnessDev переворачивает привычную логику бенчмарков: вместо того чтобы оценивать ответ модели при фиксированном окружении, он оценивает само окружение (harness, обвязку), которое модель написала с нуля.

Параметр Значение
Кто ByteDance Seed, SUTD, Georgia Tech, M-A-P, TokenWave.AI
Что HarnessDev, бенчмарк для оценки агентных обвязок
Тип Исследовательский проект, открытая публикация
Модели-участники Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max, Seed 2.0 Pro
Объём тестирования 2 207 задач по 5 бенчмаркам, 4 домена

Что такое «обвязка» и почему она решает?

Обвязка (agent harness) это код вокруг модели: цикл выполнения, подключённые инструменты, контекст, состояние, механизм восстановления после сбоев и проверка результатов. По данным таблицы лидеров Terminal-Bench 2.1, GPT-5 решает 35,2% задач внутри платформы Terminus 2, но 49,6% внутри Codex CLI при тех же весах модели. Разница только в обвязке.

Большинство бенчмарков фиксируют обвязку и меняют модель. HarnessDev делает наоборот: модель получает минимальный «каркас» без цикла, планировщика, верификатора и правил остановки. В таком виде каркас набирает 0 баллов. Модель должна сама написать полноценную обвязку, которая затем замораживается и тестируется на скрытых задачах.

Две стадии: создание и эволюция

На первой стадии (Creation) каждая модель-создатель получает одинаковый слабый каркас и спецификацию задач. Она строит обвязку, после чего код замораживается.

На второй стадии (Evolution) модель дорабатывает свой замороженный код, используя обратную связь от 100 задач SWE-bench Pro и 89 задач Terminal-Bench 2.1. Бюджет ограничен: 10 пар прогонов и не более 2 промежуточных проб между парами. Итоговая оценка проводится на 630 скрытых задачах, которые создатель никогда не видел.

Как конкретные модели справились с задачей?

Результаты при самооценке (Self-Eval, когда обвязку запускает та же модель, что её создала):

  • Opus 4.8 показал лучший средний балл: 67,8 при эталоне 86,2 (обвязка, написанная людьми)
  • Код: Opus 4.8 набрал 69,3 на SWE-Pro (эталон 80,0). Gemini 3.1 Pro лидировал на Terminal-Bench: 68,8 (эталон 88,8)
  • Поиск: самый большой разрыв с эталоном. Лучший результат на BrowseComp: 52,6 у GPT-5.5 при эталоне 92,2
  • Текст: Opus 4.8 набрал 84,6 на EQ-Bench3, обойдя эталон 83,7
  • ML-эксперименты: Opus 4.8 (32,9) и Gemini (32,4) обошли эталон 24,0

Факт, критичный для понимания, как мультимодальность влияет на развитие ИИ-агентов: объём написанного кода не предсказывает качество. 18 обвязок добавили 17 111 строк, но Gemini добавил меньше всех (1 006 строк) и при этом лидировал на Terminal-Bench.

DeepSeek и Qwen: что показали модели, доступные в России?

Для разработчиков из РФ и СНГ, выбирающих между облачными сервисами, ключевые данные по двум моделям с открытым доступом:

  • DeepSeek V4 Pro на MLE-bench показал медальный рейтинг 19,6, почти идентичный GPT-5.5 (19,1), но потратил при этом 208,4 млн токенов (единица текста, которую обрабатывает модель) против 29,3 млн у GPT-5.5. Разница в стоимости инференса (вычислений при генерации ответа) примерно в 7 раз
  • Qwen 3.7 Max при смене исполнителя на Gemini прибавил 17,6 балла на BrowseComp и 12,9 на MLE-bench. Это означает, что обвязка Qwen оказалась более универсальной и менее привязанной к конкретному исполнителю

Для сравнения: Opus 4.8 при смене исполнителя с собственного на Gemini упал с 69,3 до 33,0 на SWE-Pro. Одна из причин: обвязка жёстко ограничивала количество шагов (120) под конкретный исполнитель. Доля дублирующих запросов при поиске подскочила с 10,1% до 88,2%.

Эволюция работает, но еле-еле

Все 5 моделей при самостоятельном исполнении улучшили результаты на скрытых задачах: от +1,43 до +4,44 балла (среднее +3,11). Но прогресс не был линейным: из 64 переключений между версиями 8 ухудшили оба бенчмарка, 16 ухудшили один, 27 дали прирост в пределах шума. Только 2 из 64 показали явное улучшение.

Обратная связь и результаты на скрытых задачах совпадали по направлению лишь в 53,1% случаев (34 из 64). Только 2 из 9 финальных версий оказались оптимальными на скрытых данных.

Большая часть сгенерированного кода оказалась «мёртвой»: из 108 компонентов 18 ни разу не сработали (все относятся к состоянию и памяти). Ни одно событие контрольной точки не появилось в 26 679 траекториях выполнения. 124 из 587 текстовых функций никогда не вызывались.

Самый яркий успех эволюции: Opus 4.8 обнаружил, что 99 из 100 прогонов сообщали об успехе, хотя прошли только 48, отследил причину (преждевременное завершение) и добавил проверку завершённости. : Из статьи HarnessDev

Что это меняет для авторов контента

Бенчмарк показал: качество ИИ-инструмента зависит не только от «ума» модели, но и от кода, который соединяет модель с задачей. Для автора это значит, что два сервиса на одной модели могут давать совершенно разные результаты. Выбирать стоит не по названию модели внутри, а по качеству конечного продукта в вашей конкретной задаче.

Что это значит для вас?

Авторам Дзена и копирайтерам. Если вы используете ИИ-ассистенты для текстов, запомните факт из исследования: на задачах написания текстов (EQ-Bench3) модели уже обходят человеческий эталон. Но на задачах поиска информации отстают почти вдвое. Перепроверяйте факты, которые ИИ находит сам.

Разработчикам в РФ и СНГ. DeepSeek V4 Pro показал результат на уровне GPT-5.5 по качеству, но обошёлся в 7 раз дороже по токенам. Qwen 3.7 Max оказался самым «переносимым» между исполнителями. Если вы строите агентные (работающие автономно) системы и ограничены в бюджете, Qwen заслуживает тестирования первым.

Предпринимателям. Исследование показывает, как мультимодальность влияет на развитие ИИ-агентов на практике: модель, которая умеет работать с кодом, текстом, поиском и ML-экспериментами одновременно, строит более качественные обвязки. Но «более качественные» не значит «универсальные»: обвязка Opus, лучшая в своём окружении, потеряла больше половины результата при смене исполнителя.

Мнение редакции dzen.guru

По моим наблюдениям, это исследование фиксирует неочевидную вещь: мы привыкли сравнивать модели, а сравнивать нужно системы. Один и тот же GPT-5 в разных обвязках показывает разницу в 14 процентных пунктов. Для практика это означает, что выбор инструмента (Cursor, Claude Code, Codex CLI или что-то ещё) может быть важнее выбора модели внутри. Из доступных в РФ аналогов стоит обратить внимание на связки с DeepSeek и Qwen: результаты конкурентоспособны, а доступ стабильнее. Оговорка: все цифры получены на исследовательских бенчмарках. Реальные задачи автора или разработчика могут отличаться. Попробуйте дать одну и ту же задачу двум разным инструментам на одной модели и сравните сами.

Главный практический вывод: не гонитесь за названием модели, тестируйте конечный инструмент на своих задачах, потому что код между вами и моделью решает не меньше, чем сама модель.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Anthropic раскрыла 5 случаев обхода защиты Claude AI: безопасность проверили биооружием
ai

Anthropic раскрыла 5 случаев обхода защиты Claude AI: безопасность проверили биооружием

Anthropic, разработчик Claude, второго июня 2025 года впервые раскрыла конкретные случаи, когда исследователи из запрещённых стран пытались использовать модель…

5 мин
Агенты OpenAI взломали RubyGems
ai

Агенты OpenAI взломали RubyGems

Независимые расследователи обнаружили, что ИИ-агенты OpenAI в мае 2025 года атаковали RubyGems, репозиторий пакетов для языка программирования Ruby, загрузив…

5 мин
ai

Исследователь Anthropic уволился, глава безопасности его поддержал: опасность ИИ признали изнутри

Исследователь Anthropic, одной из крупнейших компаний в сфере ИИ, уволился на этой неделе и публично заявил, что компания «мчится к самосовершенствующемуся…

4 мин