Игорь Градов
Игорь Градов
5 мин
ai

ARC-AGI бенчмарк: 100% в тесте показывает силу кода, а не интеллект машины

Компания ARC Prize Foundation, основанная Франсуа Шолле, разработала серию бенчмарков ARC-AGI для проверки способности ИИ к обучению, и проекты, набирающие 100% в последней версии ARC-AGI-3, на деле демонстрируют силу инженерной обвязки, а не прорыв к общему интеллекту.

ARC-AGI бенчмарк: 100% в тесте показывает силу кода, а не интеллект машины
Почему это важно

Бенчмарк, задуманный как тест на обучаемость ИИ, фактически стал тестом на качество кода и архитектуры вокруг нейросети: 100% в ARC-AGI-3 не означает, что машина научилась думать.

Бенчмарки в индустрии ИИ работают как линейка: инженер проверяет свой проект, сравнивает с конкурентами и видит, где отстаёт. У каждого бенчмарка своя цель. ARC-AGI-3, последняя версия теста от ARC Prize Foundation, измеряет не навык модели, а её способность приобретать навык на лету. Именно так формулирует задачу сам Шолле. Источник этого разбора: анализ проекта Сергея Родионова (PhD, SingularityNET), включая два его препринта и публичный доклад.

Параметр Факт
Кто создал бенчмарк ARC Prize Foundation, основатель Франсуа Шолле
Текущая версия ARC-AGI-3
Год запуска первой версии 2019
Формат задач ARC-AGI-3 Интерактивные игры в стиле Atari
Ключевая метрика RHAE (число пройденных уровней и количество действий)

Как бенчмарк дошёл до интерактивных игр?

ARC-AGI-1 стартовал в 2019 году с задач на цветных сетках: модель получала два примера и должна была вывести правило, которого нет в обучающих данных (данные, на которых нейросеть училась до теста). Первые решения давали единицы процентов. Затем инженеры применили алгоритмы перебора: собирали набор простых операций над сеткой и искали подходящую комбинацию. Это работало, но упиралось в комбинаторный взрыв и не масштабировалось.

Рассуждающие модели (reasoning models, нейросети, которые «думают вслух», выстраивая цепочку рассуждений перед ответом) преодолели порог в 70%. ARC-AGI-1 продержался пять лет.

ARC-AGI-2 вышел в 2025 году и потребовал от модели удерживать контекст и применять несколько правил одновременно. Текущие большие языковые модели с этим не справились.

ARC-AGI-3 изменил формат радикально. Задачи превратились в интерактивные игры: правила неизвестны, цель неизвестна, выявить их можно только действием. Метрика RHAE оценивает два параметра: сколько уровней пройдено и сколько действий на это ушло. Эталон: обычный человек, играющий впервые. Логика простая: если ИИ-агент (программа, которая сама решает, что делать дальше) действительно выводит правила из наблюдений, он потратит мало действий. Если перебирает варианты, действий будет намного больше.

Три подхода к решению, и почему побеждает обвязка

Для нейросетей выделяются три подхода к ARC-AGI-3:

  • Прямое взаимодействие. Игра передаёт модели состояние, модель выдаёт следующее действие. Никакой внешней поддержки. Результат слабый: модель теряет нить, повторяет ошибки, допускает галлюцинации (уверенно выдумывает то, чего не было).

  • Обучение с подкреплением. Классический для нейросетей метод, но устройство бенчмарка не позволяет набрать достаточный объём данных для обучения.

  • Агентная обвязка. Модель работает в цикле с инструкцией, памятью, файловой системой и исполняемым кодом. Этот подход показал максимальный результат.

Факт, который стоит произнести вслух: ARC-AGI бенчмарк, задуманный как измеритель способности к обучению, фактически проверяет качество инженерной конструкции вокруг нейросети, а не саму нейросеть.

Что показал проект Родионова?

Проект Сергея Родионова, PhD из SingularityNET, это чистый пример третьего подхода. Схема: ИИ-агент на базе Codex получает доступ к Linux-окружению, файлам и Python. Алгоритмический контроллер отправляет агенту промпты (текстовые инструкции для модели), управляет циклом игры. Агент наблюдает состояние, строит гипотезу об устройстве мира, действует, проверяет результат, правит гипотезу.

В первом препринте Родионов заявил три ключевые идеи:

  • Исполняемая модель мира. Задача бенчмарка симулируется в Python-программе.
  • Смещение к простоте. Агент пытается заменить частные случаи общими правилами.
  • Проверка воспроизведением. Модель должна точно воспроизвести каждое записанное наблюдение. Не сходится, гипотеза отбрасывается.

Результат формально впечатляет, но по духу ARC-AGI-3 это конструкция инженера, заточенная под конкретный бенчмарк. Работать она будет только на простых, ограниченных искусственных мирах, потому что упирается в те же два барьера комбинаторного взрыва: написание кода для чуть более сложной задачи и поиск решения внутри симуляции. Задачи продолжают решаться перебором: генерация идей, проверка, цикл заново.

Абляция разрушила красивую теорию

Во второй работе Родионов провёл абляцию (последовательное отключение одного из элементов системы для оценки его вклада в результат). Выводы оказались неожиданными.

Каждый вариант системы улучшается при более сильной модели и при большем объёме рассуждения. Различия между вариантами оказались меньше ожидаемых, а эффекты отдельных компонентов не выражены.

Исполняемая модель мира, которая была вынесена в заголовок первой работы, не доказала свою полезность. Текстовый вариант, когда модель рассуждает в собственном контексте, обгоняет вариант с исполняемой моделью. На докладе Родионов подтвердил: отдельная исполняемая модель не нужна, кодовому агенту достаточно контекста. Python-симулятор проиграл простому текстовому рассуждению.

Полная верификация занимает первое место во всех четырёх настройках, хотя тратит существенно больше ресурсов. : Сергей Родионов, PhD, SingularityNET (из доклада и второй работы)

Единственный компонент, который действительно помог, это полная проверка гипотез. Но и она работает за счёт перебора, просто более аккуратного.

Что это значит для вас?

Для автора Дзена и копирайтера: когда вы видите заголовок «ИИ набрал 100% в тесте на интеллект», знайте: ARC-AGI бенчмарк проверяет не разум машины, а качество архитектуры вокруг неё. Это полезный фильтр для отсечения хайповых заголовков при написании контента про ИИ.

Для маркетолога: цифры бенчмарков в пресс-релизах не равны реальной пользе продукта. Прежде чем строить на них кампанию, стоит разобраться, что именно измерялось.

Для предпринимателя в РФ: российский проект Родионова показывает, что прорывные результаты в мировых бенчмарках достижимы из русскоязычного пространства. Но практическое применение подобных агентных систем пока ограничено искусственными средами.

Мнение редакции dzen.guru

По моим наблюдениям, ARC-AGI-3 повторяет судьбу многих бенчмарков: он задумывался как тест на обучаемость, а превратился в соревнование по сборке обвязки. Родионов сам честно показал это через абляцию, и за эту интеллектуальную честность проект заслуживает уважения. Но 100% в ARC-AGI-3 не приближают нас к AGI (искусственному общему интеллекту, то есть машине, способной решать любые задачи на уровне человека). Они приближают нас к пониманию, что перебор, упакованный в код и память, остаётся перебором. Для практиков из РФ и СНГ главный вывод: не верьте цифрам бенчмарков без разбора методологии. Проверяйте, что именно измеряет тест, прежде чем делать выводы о возможностях ИИ-инструмента.

Сам Родионов на докладе получил справедливый вопрос: а кто сказал, что человек не решает задачи перебором? Если отбросить романтику озарений и инсайтов, ни наука, ни философия пока не могут сказать по этому поводу ничего определённого. И пока этот вопрос открыт, любой результат в любом бенчмарке стоит читать с карандашом, а не с восклицательным знаком.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Контекст нейросети можно увеличить в разы: три метода без дообучения
ai

Контекст нейросети можно увеличить в разы: три метода без дообучения

Контекст нейросети (context window) определяет, сколько текста модель способна «видеть» за один раз, и когда он заканчивается, ответы становятся бессвязными, а…

7 мин
M3 Ultra: скорость генерации текста упирается в 12 токенов в секунду, и вот почему
ai

M3 Ultra: скорость генерации текста упирается в 12 токенов в секунду, и вот почему

Компания Apple позиционирует Mac Studio с чипом M3 Ultra как вершину производительности для профессионалов, но реальная скорость генерации текста большими…

6 мин
ai

Excel для строительства: как собрать управленческий экран проекта за 4 часа

Строительные проекты генерируют сотни таблиц, графиков и отчётов, но руководителю перед квартальным комитетом нужна не стопка файлов, а один экран, который за…

6 мин