ИИ для написания научной статьи провалил тест на интуицию: лучшие модели осилили лишь 20% сложных задач
Научный ИИ получил тест на «творческую интуицию», и лучшие модели справились лишь с пятой частью самых сложных заданий, показав разрыв с человеком, который проходит те же игры на 100%.
Впервые бенчмарк измеряет не знание фактов и не скорость генерации, а способность ИИ самостоятельно открывать скрытые правила незнакомой среды, то есть именно тот навык, без которого ИИ для написания научной статьи останется продвинутым автозаполнителем, а не исследователем.
Команда из Оксфорда, Принстона, MIT, KAUST, Swiss AI Lab и Inria при участии Юргена Шмидхубера (одного из пионеров глубокого обучения) представила DiG-bench (Discovery in Games, «открытия в играх»). Это набор из 70 мини-игр, где и правила, и цель спрятаны от игрока: узнать их можно только через взаимодействие со средой. Бенчмарк опубликован на GitHub и сайте digbench.ai, а 21 игру можно попробовать самому. Источник: рассылка Import AI 469, автор Джек Кларк.
| Показатель | Значение | Источник |
|---|---|---|
| Число игр в бенчмарке | 70 | DiG-bench, Import AI 469 |
| Публично доступных игр | 21 | DiG-bench, Import AI 469 |
| Число уровней сложности (тиров) | 7 | DiG-bench, Import AI 469 |
| Диапазон доступных действий за ход | от 2 до 34 | DiG-bench, Import AI 469 |
| Лучшие модели (общий зачёт) | Opus 5, Fable 5 (с Claude Code), затем GPT-5.5 | DiG-bench, Import AI 469 |
| Результат лучших моделей на Tier 7 | 0,2 (20%) | DiG-bench, Import AI 469 |
| Результат отдельных людей на Tier 7 | 100% | DiG-bench, Import AI 469 |
Что здесь на самом деле измеряли?
Представьте настольную игру, в которой вам не дали правила: ни карточки, ни инструкции. Вы нажимаете кнопки, двигаете фигуры и по реакции среды пытаетесь понять, что вообще происходит и как выиграть. Именно так устроены 70 мини-миров DiG-bench: каждый из них подчиняется собственным законам, но эти законы нигде не написаны.
Бенчмарк проверяет, умеет ли модель замечать закономерности в незнакомой среде, формулировать гипотезы и обновлять их по мере игры. По сути, это тест на «творческую интуицию», способность находить важное в новом, что критично для любого ИИ для написания научной статьи, где нужно не пересказывать известное, а обнаруживать неочевидное.
Все игры созданы вручную экспертами. Большинство из них остаются закрытыми, чтобы модели не могли обучиться на них заранее. Игры текстовые и достаточно короткие: большинство трейсов (записей хода игры) помещаются в контекстное окно (объём текста, который модель «видит» за один раз) современных моделей.
Что показали результаты?
- Opus 5 и Fable 5 с Claude Code лидируют в общем зачёте, следом идёт GPT-5.5.
- Tier 7 (самый сложный) покорился только двум моделям: Opus 5 и Fable 5 прошли 20% заданий. Люди при этом проходили те же задания полностью.
- Tier 6 частично решили три модели: Opus 5, GPT-5.5 и Kimi K3, но только с внешней обвязкой (harness), например Claude Code.
- GLM-5.2 и Gemini 3.1 Pro остановились на Tier 4: прошли отдельные уровни, но не поднялись выше.
- Ни одна модель не прошла весь бенчмарк целиком. Автор рассылки Джек Кларк прогнозирует, что паритет с человеком может быть достигнут к середине 2027 года.
Бенчмарк молодой, и у него есть ограничения, которые стоит держать в голове. Выборка из 70 игр создана вручную, а не собрана из реальных научных задач: хорошая ли это прокси для «настоящего» исследовательского мышления, пока открытый вопрос. 49 из 70 игр закрыты, поэтому независимо воспроизвести результаты на полном наборе нельзя. Прогноз паритета к 2027 году принадлежит автору рассылки, а не авторам исследования, и не подкреплён формальной моделью. Наконец, режим «experimentation» (свободная игра без жёсткого лимита ходов) мог давать моделям разные условия в зависимости от настроек. Цифры показательны как ранний ориентир, но не как окончательный приговор.
Что это значит для вас?
Если вы автор на Дзене или копирайтер. DiG-bench показывает, где ИИ пока слаб: в ситуациях, где правила не заданы и нужно думать «с нуля». Когда вы просите нейросеть написать текст по знакомому шаблону, она справляется. Когда нужно найти нетривиальный угол для статьи или выявить неочевидную тенденцию в данных, модель всё ещё значительно уступает человеку. Ваш навык видеть то, чего нет в инструкции, пока остаётся конкурентным преимуществом.
Если вы маркетолог или предприниматель. Перед тем как доверять ИИ-агенту (программе, которая сама принимает решения и действует) стратегические задачи, полезно помнить: даже лучшие модели проваливают 80% задач на «открытие неизвестного». Автоматизировать рутину можно, но разведку новых рынков и нестандартные гипотезы пока лучше оставить людям.
Если вы работаете с российскими моделями. В тесте участвовали только зарубежные модели. Ни YandexGPT, ни GigaChat, ни другие отечественные системы не были протестированы на DiG-bench. Игры открыты и текстовые, то есть технически ничто не мешает прогнать через них любую модель с API. Для тех, кто оценивает, готовы ли российские LLM (большие языковые модели) к исследовательским задачам, это конкретный и воспроизводимый способ проверить.
Мне кажется самым показательным не то, что модели набрали 20% на Tier 7, а то, что разрыв с человеком пятикратный. Это честный маркер: нейросеть умеет рассуждать по шаблону, но «нюхом» на скрытое пока не обладает. Для практиков это значит простую вещь: используйте ИИ для написания научной статьи как быстрого ассистента на этапе компиляции и черновика, но этап «а что тут вообще интересного?» оставляйте себе. По моим наблюдениям, именно на этом этапе рождается ценность, которую читатель и рецензент отличают от генерации за секунды. DiG-bench полезен ещё и тем, что даёт конкретную линейку: можно вернуться через полгода, прогнать свежие модели и увидеть, сократился ли разрыв. Следим.
Бенчмарк открыт, игры можно попробовать прямо в браузере, и это, пожалуй, лучший способ почувствовать на себе, что именно пока не даётся машине: попробуйте пройти Tier 5 и сравните свои ощущения с таблицей результатов.
По данным Import AI 469

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Дарио Амодей признал: маркетинг не вернёт доверие к ИИ, спасут только прорывы в медицине
Дарио Амодей редко появляется в соцсетях, но 9 июня вышел на X (бывший Twitter), чтобы лично ответить на обвинения инвестора Гэвина Бейкера в том, что…

Stripe купил OpenRouter за $7 млрд: 50 выручек за «прослойку» между ИИ-моделями
Stripe объявил о покупке OpenRouter, платформы маршрутизации запросов к ИИ-моделям, за 7 миллиардов долларов, и сделка закрылась всего через 90 дней после…

Что такое ИИ-агент по версии создателя Astro: без «обвязки» это просто скрипт
Пора разобраться, что стоит за термином «ИИ-агент» на практике, а не в маркетинговых презентациях: Фред Шотт, создатель веб-фреймворка Astro, выпустил…
Комментарии