Игорь Градов
Игорь Градов
5 мин
aggregator

ИИ для написания научной статьи провалил тест на интуицию: лучшие модели осилили лишь 20% сложных задач

Научный ИИ получил тест на «творческую интуицию», и лучшие модели справились лишь с пятой частью самых сложных заданий, показав разрыв с человеком, который проходит те же игры на 100%.

Почему это важно

Впервые бенчмарк измеряет не знание фактов и не скорость генерации, а способность ИИ самостоятельно открывать скрытые правила незнакомой среды, то есть именно тот навык, без которого ИИ для написания научной статьи останется продвинутым автозаполнителем, а не исследователем.

Команда из Оксфорда, Принстона, MIT, KAUST, Swiss AI Lab и Inria при участии Юргена Шмидхубера (одного из пионеров глубокого обучения) представила DiG-bench (Discovery in Games, «открытия в играх»). Это набор из 70 мини-игр, где и правила, и цель спрятаны от игрока: узнать их можно только через взаимодействие со средой. Бенчмарк опубликован на GitHub и сайте digbench.ai, а 21 игру можно попробовать самому. Источник: рассылка Import AI 469, автор Джек Кларк.

Показатель Значение Источник
Число игр в бенчмарке 70 DiG-bench, Import AI 469
Публично доступных игр 21 DiG-bench, Import AI 469
Число уровней сложности (тиров) 7 DiG-bench, Import AI 469
Диапазон доступных действий за ход от 2 до 34 DiG-bench, Import AI 469
Лучшие модели (общий зачёт) Opus 5, Fable 5 (с Claude Code), затем GPT-5.5 DiG-bench, Import AI 469
Результат лучших моделей на Tier 7 0,2 (20%) DiG-bench, Import AI 469
Результат отдельных людей на Tier 7 100% DiG-bench, Import AI 469

Что здесь на самом деле измеряли?

Представьте настольную игру, в которой вам не дали правила: ни карточки, ни инструкции. Вы нажимаете кнопки, двигаете фигуры и по реакции среды пытаетесь понять, что вообще происходит и как выиграть. Именно так устроены 70 мини-миров DiG-bench: каждый из них подчиняется собственным законам, но эти законы нигде не написаны.

Бенчмарк проверяет, умеет ли модель замечать закономерности в незнакомой среде, формулировать гипотезы и обновлять их по мере игры. По сути, это тест на «творческую интуицию», способность находить важное в новом, что критично для любого ИИ для написания научной статьи, где нужно не пересказывать известное, а обнаруживать неочевидное.

Все игры созданы вручную экспертами. Большинство из них остаются закрытыми, чтобы модели не могли обучиться на них заранее. Игры текстовые и достаточно короткие: большинство трейсов (записей хода игры) помещаются в контекстное окно (объём текста, который модель «видит» за один раз) современных моделей.

Что показали результаты?

  • Opus 5 и Fable 5 с Claude Code лидируют в общем зачёте, следом идёт GPT-5.5.
  • Tier 7 (самый сложный) покорился только двум моделям: Opus 5 и Fable 5 прошли 20% заданий. Люди при этом проходили те же задания полностью.
  • Tier 6 частично решили три модели: Opus 5, GPT-5.5 и Kimi K3, но только с внешней обвязкой (harness), например Claude Code.
  • GLM-5.2 и Gemini 3.1 Pro остановились на Tier 4: прошли отдельные уровни, но не поднялись выше.
  • Ни одна модель не прошла весь бенчмарк целиком. Автор рассылки Джек Кларк прогнозирует, что паритет с человеком может быть достигнут к середине 2027 года.
Как это читать

Бенчмарк молодой, и у него есть ограничения, которые стоит держать в голове. Выборка из 70 игр создана вручную, а не собрана из реальных научных задач: хорошая ли это прокси для «настоящего» исследовательского мышления, пока открытый вопрос. 49 из 70 игр закрыты, поэтому независимо воспроизвести результаты на полном наборе нельзя. Прогноз паритета к 2027 году принадлежит автору рассылки, а не авторам исследования, и не подкреплён формальной моделью. Наконец, режим «experimentation» (свободная игра без жёсткого лимита ходов) мог давать моделям разные условия в зависимости от настроек. Цифры показательны как ранний ориентир, но не как окончательный приговор.

Что это значит для вас?

Если вы автор на Дзене или копирайтер. DiG-bench показывает, где ИИ пока слаб: в ситуациях, где правила не заданы и нужно думать «с нуля». Когда вы просите нейросеть написать текст по знакомому шаблону, она справляется. Когда нужно найти нетривиальный угол для статьи или выявить неочевидную тенденцию в данных, модель всё ещё значительно уступает человеку. Ваш навык видеть то, чего нет в инструкции, пока остаётся конкурентным преимуществом.

Если вы маркетолог или предприниматель. Перед тем как доверять ИИ-агенту (программе, которая сама принимает решения и действует) стратегические задачи, полезно помнить: даже лучшие модели проваливают 80% задач на «открытие неизвестного». Автоматизировать рутину можно, но разведку новых рынков и нестандартные гипотезы пока лучше оставить людям.

Если вы работаете с российскими моделями. В тесте участвовали только зарубежные модели. Ни YandexGPT, ни GigaChat, ни другие отечественные системы не были протестированы на DiG-bench. Игры открыты и текстовые, то есть технически ничто не мешает прогнать через них любую модель с API. Для тех, кто оценивает, готовы ли российские LLM (большие языковые модели) к исследовательским задачам, это конкретный и воспроизводимый способ проверить.

Мнение редакции dzen.guru

Мне кажется самым показательным не то, что модели набрали 20% на Tier 7, а то, что разрыв с человеком пятикратный. Это честный маркер: нейросеть умеет рассуждать по шаблону, но «нюхом» на скрытое пока не обладает. Для практиков это значит простую вещь: используйте ИИ для написания научной статьи как быстрого ассистента на этапе компиляции и черновика, но этап «а что тут вообще интересного?» оставляйте себе. По моим наблюдениям, именно на этом этапе рождается ценность, которую читатель и рецензент отличают от генерации за секунды. DiG-bench полезен ещё и тем, что даёт конкретную линейку: можно вернуться через полгода, прогнать свежие модели и увидеть, сократился ли разрыв. Следим.

Бенчмарк открыт, игры можно попробовать прямо в браузере, и это, пожалуй, лучший способ почувствовать на себе, что именно пока не даётся машине: попробуйте пройти Tier 5 и сравните свои ощущения с таблицей результатов.

По данным Import AI 469

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Дарио Амодей признал: маркетинг не вернёт доверие к ИИ, спасут только прорывы в медицине
aggregator

Дарио Амодей признал: маркетинг не вернёт доверие к ИИ, спасут только прорывы в медицине

Дарио Амодей редко появляется в соцсетях, но 9 июня вышел на X (бывший Twitter), чтобы лично ответить на обвинения инвестора Гэвина Бейкера в том, что…

4 мин
Stripe купил OpenRouter за $7 млрд: 50 выручек за «прослойку» между ИИ-моделями
aggregator

Stripe купил OpenRouter за $7 млрд: 50 выручек за «прослойку» между ИИ-моделями

Stripe объявил о покупке OpenRouter, платформы маршрутизации запросов к ИИ-моделям, за 7 миллиардов долларов, и сделка закрылась всего через 90 дней после…

5 мин
Что такое ИИ-агент по версии создателя Astro: без «обвязки» это просто скрипт
aggregator

Что такое ИИ-агент по версии создателя Astro: без «обвязки» это просто скрипт

Пора разобраться, что стоит за термином «ИИ-агент» на практике, а не в маркетинговых презентациях: Фред Шотт, создатель веб-фреймворка Astro, выпустил…

5 мин