Тест ARC AGI 2: eval в 2,25 раза крупнее train, локальные замеры солверов завышены
Компания ARC Prize не скрывает, что два публичных набора задач тест ARC AGI 2 собраны по-разному, но до сих пор никто не показал, насколько именно они расходятся и по каким осям, а значит, локальные замеры солверов на train могли систематически завышать результат.

Независимый анализ впервые даёт распределительную статистику различий между train и eval в тест ARC AGI 2 и готовое подмножество из train, подобранное под структуру eval, чтобы бенчмаркинг на локальной машине перестал врать.
Бенчмарк ARC-AGI-2 (набор головоломок для проверки абстрактного мышления ИИ) состоит из двух публичных файлов: train на 1000 задач и eval на 120. Документация ARC Prize прямо предупреждает: train проще, eval калиброван под закрытый тест. Однако количественного сравнения именно второго поколения бенчмарка до этого разбора не публиковалось. Источник исследования: автор замерил шесть структурных признаков по демонстрационным парам обоих наборов, проверил расхождение статистическими критериями и выложил CSV с подмножеством train, повторяющим структуру eval.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Распределительный анализ train и eval ARC-AGI-2 плюс подмножество для локального бенчмаркинга | Июнь 2025 | Независимый исследователь (публикация с открытым кодом) | Бесплатно, открытый репозиторий |
Шесть осей расхождения и почему средних недостаточно
-
Площадь выходной сетки. Медианная задача train занимает 100 клеток на выходе, у eval их 225. Eval буквально крупнее, и солвер, натренированный на мелких сетках, не увидит этого по средним.
-
Число тестовых входов. Самый резкий разрыв из всех шести (p = 3.95e-30 по критерию Манна-Уитни). Два и более тестовых входа требуются у 6,9% задач train и у 40,8% задач eval. Медианы при этом совпадают (обе равны единице), разница живёт в форме распределения, а не в центре.
-
Число цветов и площадь входа. По обеим осям eval разноцветнее и крупнее. Расхождение подтверждено критерием Колмогорова-Смирнова (KS) с запасом.
-
Число демонстрационных пар. Единственная ось, где eval мельче: в среднем 2,98 пары против 3,23 у train. Критерий KS здесь на грани (0,125 при пороге 0,131), но Манн-Уитни отвергает совпадение (скорректированное p = 2,83e-03 по методу Холма).
-
Все шесть осей вместе. Поправка на множественные сравнения по методу Холма при уровне 0,05 сохраняет значимость по всем шести признакам, включая самый слабый.
-
Структура, а не сложность. Автор честно оговаривает: его индекс проверен против человеческих решений (данные H-ARC, 1393 участника) и проверку не прошёл. Измерено расхождение формы задач, а не их трудности для человека.
Как попробовать?
-
Скачайте файлы
arc-agi_training_challenges.jsonиarc-agi_evaluation_challenges.jsonиз репозитория ARC-AGI-2 на GitHub. Отпечатки (sha256) для воспроизводимости приведены в исследовании, убедитесь, что ваши файлы совпадают: наборы обновлялись в мае 2025. -
Загрузите CSV с подмножеством train, подобранным под eval по структуре. Файл лежит в репозитории автора исследования. Это готовая выборка, на которой локальный бенчмаркинг даёт оценку, близкую к реальному eval.
-
Запустите свой солвер (решатель задач ARC) на этом подмножестве вместо случайной выборки из train. Сравните результат с прежними замерами: если разница заметная, ваш прогресс был завышен.
-
Повторите расчёт признаков по коду из репозитория, если хотите убедиться в цифрах самостоятельно. Обратите внимание на определение площади: произведение медианной высоты на медианную ширину не равно медиане площадей, расхождение возникает у 23,5% задач train и 35,0% eval.
Есть ли российский аналог тест ARC AGI 2?
Прямого аналога ARC-AGI-2 в российской ИИ-экосистеме нет. YandexGPT и GigaChat проходят другие бенчмарки (MMLU, русскоязычные тесты), но задачи на абстрактное визуальное мышление в формате ARC в публичных русскоязычных наборах пока не представлены. Для автора или предпринимателя из РФ это означает: если вы оцениваете рассуждающие способности ИИ, ARC-AGI-2 остаётся единственным открытым бенчмарком такого типа, и работать с ним придётся на английском.
Этот разбор решает конкретную боль всех, кто пишет солверы для ARC: локальные метрики на train завышали результат, потому что train и eval собраны из разных распределений. Подмножество из train, подобранное под eval, это простой и бесплатный способ получить честную оценку без доступа к закрытому тесту.
Для авторов Дзена и маркетологов, далёких от ML-соревнований, главный вывод другой: бенчмарки врут, если не знать, как устроены данные внутри. Когда вам показывают «наша модель решает 80% задач ARC», спрашивайте: на train или на eval? Разница между ними, как видно из цифр, принципиальная.
Оговорка: исследование измеряет структуру задач (размер сетки, число цветов, число тестовых входов), а не когнитивную сложность. Автор сам признаёт, что его индекс не предсказывает трудность для человека. Поэтому подмножество полезно для калибровки солвера, но не для оценки «интеллекта» модели в широком смысле.
Что сделать сегодня: если вы замеряете прогресс на случайной выборке из train, замените её на опубликованное подмножество. Это займёт пять минут и покажет реальную картину.
Частые вопросы
Почему нельзя просто взять случайную выборку из train?
Потому что train и eval лежат в разных распределениях по всем шести измеренным осям. Случайная выборка из train будет содержать задачи с мелкими сетками и одним тестовым входом, тогда как eval требует крупных сеток и множественных тестовых входов у 40,8% задач. Солвер, показывающий хороший результат на train, может провалиться на eval просто из-за несовпадения структуры.
Это значит, что ARC-AGI-2 плохо устроен?
Нет. Документация ARC Prize прямо указывает, что train проще и не калиброван, а eval соответствует закрытому тесту. Расхождение заложено намеренно: train нужен для обучения и экспериментов, eval для оценки. Проблема не в бенчмарке, а в том, что разработчики солверов используют train как прокси для eval, не учитывая структурный сдвиг.
Нужны ли технические знания, чтобы воспользоваться подмножеством?
Минимальные. CSV с подмножеством это просто список идентификаторов задач из train. Если вы уже запускаете солвер на задачах ARC, достаточно отфильтровать задачи по этому списку. Код для воспроизведения расчётов открыт, но для практического использования подмножества он не обязателен.
Для тех, кто строит или тестирует солверы ARC, вывод один: замените случайную выборку из train на калиброванное подмножество и пересчитайте свои метрики, скорее всего, реальный прогресс окажется скромнее, чем казалось.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Etched оценили в $21 млрд: финансирование ИИ-стартапов смещается от моделей к чипам
Компания Etched во вторник объявила о привлечении ещё $700 млн при оценке $21 млрд, и это четырёхкратный рост за год, показывающий, как быстро инвесторы готовы…

Инструменты и платформы для работы с ИИ устаревают быстрее, чем компании их осваивают: как перестроиться
Рынок ИИ-инструментов перестраивает IT-профессии изнутри: знать код уже мало, и российские компании ищут инженеров, которые умеют говорить на языке бизнеса и…

Экономия токенов нейросети в 2‑10 раз: пять приёмов, которые работают уже сейчас
Каждый запрос к нейросети тратит токены (единицы текста, за которые вы платите или которые списываются из лимита подписки), и чем длиннее контекст, тем быстрее…
Комментарии