ARC-AGI бенчмарк: 100% в тесте показывает силу кода, а не интеллект машины
Компания ARC Prize Foundation, основанная Франсуа Шолле, разработала серию бенчмарков ARC-AGI для проверки способности ИИ к обучению, и проекты, набирающие 100% в последней версии ARC-AGI-3, на деле демонстрируют силу инженерной обвязки, а не прорыв к общему интеллекту.

Бенчмарк, задуманный как тест на обучаемость ИИ, фактически стал тестом на качество кода и архитектуры вокруг нейросети: 100% в ARC-AGI-3 не означает, что машина научилась думать.
Бенчмарки в индустрии ИИ работают как линейка: инженер проверяет свой проект, сравнивает с конкурентами и видит, где отстаёт. У каждого бенчмарка своя цель. ARC-AGI-3, последняя версия теста от ARC Prize Foundation, измеряет не навык модели, а её способность приобретать навык на лету. Именно так формулирует задачу сам Шолле. Источник этого разбора: анализ проекта Сергея Родионова (PhD, SingularityNET), включая два его препринта и публичный доклад.
| Параметр | Факт |
|---|---|
| Кто создал бенчмарк | ARC Prize Foundation, основатель Франсуа Шолле |
| Текущая версия | ARC-AGI-3 |
| Год запуска первой версии | 2019 |
| Формат задач ARC-AGI-3 | Интерактивные игры в стиле Atari |
| Ключевая метрика | RHAE (число пройденных уровней и количество действий) |
Как бенчмарк дошёл до интерактивных игр?
ARC-AGI-1 стартовал в 2019 году с задач на цветных сетках: модель получала два примера и должна была вывести правило, которого нет в обучающих данных (данные, на которых нейросеть училась до теста). Первые решения давали единицы процентов. Затем инженеры применили алгоритмы перебора: собирали набор простых операций над сеткой и искали подходящую комбинацию. Это работало, но упиралось в комбинаторный взрыв и не масштабировалось.
Рассуждающие модели (reasoning models, нейросети, которые «думают вслух», выстраивая цепочку рассуждений перед ответом) преодолели порог в 70%. ARC-AGI-1 продержался пять лет.
ARC-AGI-2 вышел в 2025 году и потребовал от модели удерживать контекст и применять несколько правил одновременно. Текущие большие языковые модели с этим не справились.
ARC-AGI-3 изменил формат радикально. Задачи превратились в интерактивные игры: правила неизвестны, цель неизвестна, выявить их можно только действием. Метрика RHAE оценивает два параметра: сколько уровней пройдено и сколько действий на это ушло. Эталон: обычный человек, играющий впервые. Логика простая: если ИИ-агент (программа, которая сама решает, что делать дальше) действительно выводит правила из наблюдений, он потратит мало действий. Если перебирает варианты, действий будет намного больше.
Три подхода к решению, и почему побеждает обвязка
Для нейросетей выделяются три подхода к ARC-AGI-3:
-
Прямое взаимодействие. Игра передаёт модели состояние, модель выдаёт следующее действие. Никакой внешней поддержки. Результат слабый: модель теряет нить, повторяет ошибки, допускает галлюцинации (уверенно выдумывает то, чего не было).
-
Обучение с подкреплением. Классический для нейросетей метод, но устройство бенчмарка не позволяет набрать достаточный объём данных для обучения.
-
Агентная обвязка. Модель работает в цикле с инструкцией, памятью, файловой системой и исполняемым кодом. Этот подход показал максимальный результат.
Факт, который стоит произнести вслух: ARC-AGI бенчмарк, задуманный как измеритель способности к обучению, фактически проверяет качество инженерной конструкции вокруг нейросети, а не саму нейросеть.
Что показал проект Родионова?
Проект Сергея Родионова, PhD из SingularityNET, это чистый пример третьего подхода. Схема: ИИ-агент на базе Codex получает доступ к Linux-окружению, файлам и Python. Алгоритмический контроллер отправляет агенту промпты (текстовые инструкции для модели), управляет циклом игры. Агент наблюдает состояние, строит гипотезу об устройстве мира, действует, проверяет результат, правит гипотезу.
В первом препринте Родионов заявил три ключевые идеи:
- Исполняемая модель мира. Задача бенчмарка симулируется в Python-программе.
- Смещение к простоте. Агент пытается заменить частные случаи общими правилами.
- Проверка воспроизведением. Модель должна точно воспроизвести каждое записанное наблюдение. Не сходится, гипотеза отбрасывается.
Результат формально впечатляет, но по духу ARC-AGI-3 это конструкция инженера, заточенная под конкретный бенчмарк. Работать она будет только на простых, ограниченных искусственных мирах, потому что упирается в те же два барьера комбинаторного взрыва: написание кода для чуть более сложной задачи и поиск решения внутри симуляции. Задачи продолжают решаться перебором: генерация идей, проверка, цикл заново.
Абляция разрушила красивую теорию
Во второй работе Родионов провёл абляцию (последовательное отключение одного из элементов системы для оценки его вклада в результат). Выводы оказались неожиданными.
Каждый вариант системы улучшается при более сильной модели и при большем объёме рассуждения. Различия между вариантами оказались меньше ожидаемых, а эффекты отдельных компонентов не выражены.
Исполняемая модель мира, которая была вынесена в заголовок первой работы, не доказала свою полезность. Текстовый вариант, когда модель рассуждает в собственном контексте, обгоняет вариант с исполняемой моделью. На докладе Родионов подтвердил: отдельная исполняемая модель не нужна, кодовому агенту достаточно контекста. Python-симулятор проиграл простому текстовому рассуждению.
Полная верификация занимает первое место во всех четырёх настройках, хотя тратит существенно больше ресурсов. : Сергей Родионов, PhD, SingularityNET (из доклада и второй работы)
Единственный компонент, который действительно помог, это полная проверка гипотез. Но и она работает за счёт перебора, просто более аккуратного.
Что это значит для вас?
Для автора Дзена и копирайтера: когда вы видите заголовок «ИИ набрал 100% в тесте на интеллект», знайте: ARC-AGI бенчмарк проверяет не разум машины, а качество архитектуры вокруг неё. Это полезный фильтр для отсечения хайповых заголовков при написании контента про ИИ.
Для маркетолога: цифры бенчмарков в пресс-релизах не равны реальной пользе продукта. Прежде чем строить на них кампанию, стоит разобраться, что именно измерялось.
Для предпринимателя в РФ: российский проект Родионова показывает, что прорывные результаты в мировых бенчмарках достижимы из русскоязычного пространства. Но практическое применение подобных агентных систем пока ограничено искусственными средами.
По моим наблюдениям, ARC-AGI-3 повторяет судьбу многих бенчмарков: он задумывался как тест на обучаемость, а превратился в соревнование по сборке обвязки. Родионов сам честно показал это через абляцию, и за эту интеллектуальную честность проект заслуживает уважения. Но 100% в ARC-AGI-3 не приближают нас к AGI (искусственному общему интеллекту, то есть машине, способной решать любые задачи на уровне человека). Они приближают нас к пониманию, что перебор, упакованный в код и память, остаётся перебором. Для практиков из РФ и СНГ главный вывод: не верьте цифрам бенчмарков без разбора методологии. Проверяйте, что именно измеряет тест, прежде чем делать выводы о возможностях ИИ-инструмента.
Сам Родионов на докладе получил справедливый вопрос: а кто сказал, что человек не решает задачи перебором? Если отбросить романтику озарений и инсайтов, ни наука, ни философия пока не могут сказать по этому поводу ничего определённого. И пока этот вопрос открыт, любой результат в любом бенчмарке стоит читать с карандашом, а не с восклицательным знаком.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Контекст нейросети можно увеличить в разы: три метода без дообучения
Контекст нейросети (context window) определяет, сколько текста модель способна «видеть» за один раз, и когда он заканчивается, ответы становятся бессвязными, а…

M3 Ultra: скорость генерации текста упирается в 12 токенов в секунду, и вот почему
Компания Apple позиционирует Mac Studio с чипом M3 Ultra как вершину производительности для профессионалов, но реальная скорость генерации текста большими…
Excel для строительства: как собрать управленческий экран проекта за 4 часа
Строительные проекты генерируют сотни таблиц, графиков и отчётов, но руководителю перед квартальным комитетом нужна не стопка файлов, а один экран, который за…
Комментарии