Игорь Градов
Игорь Градов
5 мин
ai

Nvidia довела модель с 30% до 100% на бенчмарке, сменив только инфраструктуру для нейросетей

Microsoft опубликовала в апреле исследование, где 19 больших языковых моделей на длительных задачах с документами заполняли файлы ошибками, а модели, принимавшие решения самостоятельно, удаляли файлы пользователей и даже целые базы данных.

Nvidia довела модель с 30% до 100% на бенчмарке, сменив только инфраструктуру для нейросетей

Nvidia в пятницу опубликовала исследование, которое показало: для долгосрочных задач ИИ-агентов решающую роль играет не сама модель, а её инфраструктура для нейросетей, система управления памятью, контекстом и надзором вокруг модели.

Почему это важно

Исследователи Nvidia добились 100% на бенчмарке ARC-AGI-3, не меняя модель, а только перестроив «обвязку» вокруг неё: без этой обвязки та же модель набрала 30%. Это переворачивает привычное представление о том, что главное, выбрать «правильную» нейросеть.

Результаты Nvidia подтверждают тренд, который набирает силу: выбор модели (Claude, GPT или другой) важен, но куда сильнее на результат влияет инфраструктура для нейросетей, то есть «харнесс» (harness, обвязка, набор инструментов вокруг модели, который управляет её памятью, обратной связью и контекстом). Исследование опубликовано как открытая работа Nvidia, а комментарии вице-президента по продукту Аделя Эль-Халлака приводит TechCrunch.

Показатель Значение Источник
Результат Claude Opus 5 с обвязкой AVO на ARC-AGI-3 100% Исследование Nvidia
Результат Claude Opus 5 без обвязки на ARC-AGI-3 30% (лучший среди всех протестированных моделей) Исследование Nvidia
Результат моделей OpenAI на ARC-AGI-3 до настройки обвязки менее 10% Исследование OpenAI
Рост результатов OpenAI после настройки двух параметров обвязки в 3 раза Исследование OpenAI
Влияние обвязки на стоимость при той же модели до 2 раз Databricks, CEO Али Годси, TechCrunch

Что измеряли?

Исследователи Nvidia взяли бенчмарк ARC-AGI-3, набор двумерных игр-головоломок без инструкций. Модель должна сама понять правила и выиграть. 100% означает, что модель справляется с головоломками на уровне человека.

Такие задачи называют «долгосрочными» (long-horizon tasks): это не разовый ответ на промпт, а цепочка решений, иногда растянутая на дни. Именно на таких задачах модели чаще всего «теряют нить», отвлекаются, начинают выдумывать или идти по кругу.

Ключевой приём: исследователи создали собственную обвязку под названием AVO (Agentic Variation Operators). Она включала два компонента, которых обычно нет у стандартных инструментов вроде Claude Code или Codex:

  • Управление памятью и контекстом. Обвязка следила за тем, какую информацию модель «помнит», и вовремя подавала нужный контекст.
  • Агент-надзиратель (supervisor). Отдельный ИИ-агент, который действовал как руководитель: если основная модель застревала, шла по кругу или уходила в тупик, надзиратель «подталкивал» её в нужном направлении.

«Он почти как CEO: подталкивает агента, когда тот отклоняется, начинает исследовать тупиковый путь или возвращается к тому, что уже пробовал» : Адель Эль-Халлак, вице-президент по продукту подразделения ИИ Nvidia, TechCrunch

Что обнаружили?

  • Без обвязки модель проваливается. Claude Opus 5, лучшая из протестированных моделей, без обвязки набрала 30% на ARC-AGI-3. С обвязкой AVO тот же Opus 5 показал 100%.
  • OpenAI подтвердила эффект независимо. Модели OpenAI на том же бенчмарке показывали менее 10%. После настройки всего двух параметров обвязки результаты выросли втрое, по данным собственного исследования OpenAI, опубликованного месяцем ранее. Но ни одна модель OpenAI не приблизилась к 100%.
  • Обвязка влияет не только на точность, но и на стоимость. По данным Databricks, одна и та же модель с разными обвязками может стоить вдвое дороже. Как сказал CEO Databricks Али Годси в интервью TechCrunch: «Вы думаете: вот дорогая модель, вот дешёвая. Но подождите, какую обвязку вы используете? Одна обвязка сама по себе может удвоить ваши расходы».
  • Надзиратель оказался решающим элементом. Именно компонент «supervisor» вытянул результат до 100%. Большинство пользователей ИИ-агентов сегодня работают с одним слоем обвязки (Claude Code, Codex, Hermes). Исследователи Nvidia показали, что этого мало для сложных задач.

Важная деталь: AVO не является новым продуктом Nvidia. Компания выпускает открытые компоненты для построения обвязок под брендом Nemo, часть из них коммерческая, многое доступно бесплатно.

Как это читать

Исследование проведено на одном бенчмарке (ARC-AGI-3), который измеряет интерактивное рассуждение в формате головоломок. Результаты на реальных бизнес-задачах могут отличаться. Nvidia тестировала свою собственную обвязку AVO, независимого воспроизведения пока нет. Кроме того, Nvidia заинтересована в продвижении открытого стека инфраструктуры, потому что продаёт GPU, на которых этот стек работает, поэтому выводы стоит читать с поправкой на коммерческий интерес.

Что это значит для вас?

Авторам Дзена и копирайтерам. Если вы используете Claude, GPT или другую модель для написания текстов и замечаете, что на длинных задачах (серия статей, план контента на месяц, редактирование большого документа) модель «плывёт», проблема, скорее всего, не в модели. Попробуйте разбивать задачу на этапы, сохранять промежуточные результаты и возвращать модели контекст вручную. Это ручной аналог того, что делает обвязка.

Маркетологам. Прежде чем переплачивать за подписку на «лучшую» модель, проверьте, как организован процесс вокруг неё. Системный промпт (system prompt, постоянная инструкция, которую модель получает перед каждым диалогом), разбивка задачи на шаги и контроль промежуточных результатов дают больший прирост качества, чем смена модели.

Предпринимателям в РФ и СНГ. Исследование Nvidia прямо говорит: инфраструктура для нейросетей важнее выбора конкретной модели. Это хорошая новость. Даже если доступ к Claude Opus 5 или GPT ограничен из-за санкций, вы можете строить качественную обвязку вокруг доступных решений. Из доступных в РФ аналогов: YandexGPT и GigaChat. Компоненты Nvidia Nemo открыты, их можно развернуть локально. Добавление агента-надзирателя и грамотное управление памятью модели по результатам этого исследования дали прирост с 30% до 100%, а это работа над обвязкой, а не над самой моделью.

Мнение редакции dzen.guru

Я вижу в этом исследовании подтверждение того, что мы в dzen.guru наблюдаем на практике: авторы тратят время на выбор между Claude и GPT, тогда как реальный выигрыш лежит в том, как именно вы организуете работу с моделью. Системный промпт, разбивка на этапы, проверка промежуточных результатов, это и есть ваша «обвязка». Она не требует программирования. А для тех, кто строит автоматизацию, открытость компонентов Nvidia Nemo означает, что можно собрать свой стек, контролировать каждый элемент и не зависеть от одного провайдера. Модель это мозг агента, но без тела, памяти и руководителя мозг просто галлюцинирует (уверенно выдумывает то, чего не было) в пустоту.

Перестаньте искать «лучшую модель» и начните строить обвязку: системный промпт, разбивку на шаги, контроль промежуточного результата и, если задача сложная, второго агента-надзирателя, который вернёт первого на рельсы.

По данным TechCrunch

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Нейросеть Илона Маска Grok доказала гипотезу, открытую 4 года: математикам не хватало переформулировки
ai

Нейросеть Илона Маска Grok доказала гипотезу, открытую 4 года: математикам не хватало переформулировки

Нейросеть Илона Маска Grok 4.6 доказала открытую комбинаторную гипотезу, которую математики не могли закрыть четыре года, причём ключом стала не вычислительная…

7 мин
Gemma нейросеть набрала миллиард загрузок: от спутников NASA до онкологии Йеля
ai

Gemma нейросеть набрала миллиард загрузок: от спутников NASA до онкологии Йеля

Компания Google сообщила о миллиарде загрузок семейства открытых моделей Gemma и представила репозиторий «Awesome Gemma» на GitHub, собирающий лучшие проекты…

5 мин
Google запустила виртуальные туры по 60 паркам США: Gemini ведёт экскурсию голосом
ai

Google запустила виртуальные туры по 60 паркам США: Gemini ведёт экскурсию голосом

Компания Google совместно со Службой национальных парков США 22 апреля запустила интерактивный хаб United Parks of America на платформе Google Arts &…

5 мин