Игорь Градов
Игорь Градов
5 мин
ai

Claude AI модель Fable 5 решила втрое больше задач, чем GPT: надёжность важнее пикового навыка

Claude AI модель Fable 5 решила втрое больше задач бенчмарка MirrorCode, чем GPT-5.6 Sol, причём разрыв объясняется не превосходством в интеллекте, а стабильностью на длинных многодневных прогонах, где один сбой обнуляет результат.

Claude AI модель Fable 5 решила втрое больше задач, чем GPT: надёжность важнее пикового навыка
Почему это важно

Бенчмарк проверяет не «знание ответа», а способность модели довести сложную задачу до конца без единого провала на скрытых тестах. Для тех, кто выбирает модель под реальную работу с кодом, это редкий случай, когда измерена именно надёжность, а не пиковый навык.

Исследовательская группа Epoch AI обновила лидерборд бенчмарка MirrorCode, добавив свежие результаты флагманов Anthropic и OpenAI. Бенчмарк разработан совместно с лабораторией METR и устроен необычно: модель должна переписать целую программу с нуля, не видя исходного кода. На многих других тестах эти же модели идут почти вровень, а кое-где Sol даже впереди, поэтому трёхкратный разрыв именно здесь потребовал объяснения.

Показатель Значение Источник
Результат Claude Fable 5 64% задач решено Epoch AI, лидерборд MirrorCode
Результат GPT-5.6 Sol 20% задач решено Epoch AI, лидерборд MirrorCode
Количество программ в лидерборде 15 (средний и большой размер) Epoch AI
Языки реализации Два языка на каждую задачу (Go и Ada) Epoch AI
Бюджет на попытку 10 млрд токенов (токен, минимальная единица текста для модели), 7 дней Epoch AI
Число прогонов каждой задачи 3 Epoch AI
Самый долгий прогон 19 дней, 2 600 долларов Epoch AI
Программы с признаками запоминания 17 из 25 целевых Epoch AI

Что именно проверяет MirrorCode?

Модель получает «чёрный ящик»: исполняемый файл, который можно только запускать, документацию и часть тестов. Интернет в песочнице (изолированной среде, где модель работает без доступа наружу) отключён.

Программы настоящие и сложные: потоковый редактор sed, линтер Ruff (инструмент проверки кода на ошибки), утилиты биоинформатики, интерпретаторы языков, криптографические библиотеки, алгоритмы сжатия данных.

Зачёт жёсткий: решением считается только реализация, прошедшая 100% тестов, включая скрытые, которых модель не видела. Подогнать ответы под известные тесты или собрать таблицу готовых результатов не получится. Каждую из 15 программ нужно реализовать на двух языках, каждая задача прогоняется трижды.

Почему разрыв втрое, если модели «одного класса»?

Тепловая карта результатов по отдельным задачам, которую Epoch публикует вместе с лидербордом, раскрывает механику разрыва.

  • Sol умеет, но нестабилен. В его строке преобладают 50%, 33% и 17% успешных попыток. Claude AI модель Fable 5 те же задачи закрывает почти всегда: подряд идут 100% и 83%.
  • Разрыв не между «умеет» и «не умеет», а между «иногда доводит до конца» и «доводит почти всегда». Когда одна попытка длится дни, включает тысячи шагов и сотни тестов, единственный проваленный крайний случай обнуляет результат целиком. На такой дистанции решает надёжность, а не разовая вспышка.
  • Язык Ada обнажает разницу ещё резче. По правилам половину реализаций модели обязаны писать на Ada, редком языке из мира авионики и военных систем. Fable почти не проседает: 64% на Go против 61% на Ada, разница в три процентных пункта. У Sol потеря составляет пятую часть результата (с 24% до 19%), у GPT-5.4 почти половину (с 21% до 12%), а GPT-5.5 падает более чем втрое (с 17% до 5%).

Почему Ada важна для оценки честности теста?

Главная претензия к MirrorCode: программы в бенчмарке с открытым исходным кодом, и модели почти наверняка видели их во время обучения (обучающие данные могли содержать исходники). Это называется контаминацией, или загрязнением данных, и может завышать результаты.

Но реализаций этих программ на Ada в открытом доступе практически нет. Модели не могут «вспомнить» код, его приходится писать заново. Устойчивость Fable на Ada говорит скорее о навыке, чем о натренированной памяти.

Как это читать: оговорки и ограничения

Собственная проверка Epoch на запоминание нашла его признаки у 17 из 25 целевых программ. Авторы подчёркивают: результаты к памяти не сводятся (модели решали и незапомненные программы, а запомненные sed и Ruff проваливали), но признают, что вклад запоминания исключить нельзя. Второе ограничение авторы называют сами: MirrorCode проверяет работу по идеально точной спецификации (эталонная программа плюс тесты однозначно задают, что должно получиться). Реальная разработка так почти никогда не выглядит: задачи размыты, требования меняются, тестов может не быть. Результаты не доказывают, что ИИ потянет произвольный программный проект.

Что это значит для вас?

Разработчику и техническому автору. Если вы выбираете модель для долгих задач с кодом, где важен конечный результат (рефакторинг, портирование, генерация модулей), данные MirrorCode показывают: Claude AI модель Fable 5 стабильнее доводит работу до конца. Но только в условиях чёткой спецификации. Для задач с размытыми требованиями бенчмарк ничего не гарантирует.

Автору Дзена и копирайтеру. Пиковая «гениальность» модели и её надёжность на длинной дистанции измеряются по-разному. Когда вы просите ИИ написать один пост, разницы можете не заметить. Когда выстраиваете цепочку из десятков шагов (серия статей, структурированный курс, обработка большого массива), сбой на любом звене ломает всё. Для таких задач стоит тестировать модель именно на устойчивость, а не на яркость разового ответа.

Маркетологу и предпринимателю в РФ. Из доступных в России моделей прямого аналога Fable нет: ни Anthropic, ни OpenAI официально не работают на российском рынке. Из отечественных сервисов для работы с кодом можно пробовать YandexGPT и GigaChat, но сопоставимых данных по длинным автономным прогонам для них пока не опубликовано.

Мнение редакции dzen.guru

Этот бенчмарк ценен не итоговой цифрой «64 против 20», а тем, что он измеряет. В реальной работе с ИИ-агентами (программами, которые выполняют цепочку действий самостоятельно) именно стабильность определяет, можно ли доверить модели задачу на несколько дней. Я проверял это на собственных задачах с длинными промптами (текстовыми инструкциями для модели): модель, которая блестяще справляется с первым шагом и сыплется на двадцатом, на практике бесполезна. MirrorCode, при всех оговорках про загрязнение данных и искусственную чистоту условий, пока единственный публичный тест, который это фиксирует. Для тех, кто строит рабочие процессы вокруг ИИ, это полезнее, чем очередной рейтинг «кто умнее».

Выбирая модель для серьёзной работы, смотрите не на рейтинг «кто решил больше задач», а на то, как часто модель доводит задачу до конца при повторных запусках: именно это показывает MirrorCode, и именно это определяет, сэкономит ИИ ваше время или потратит его впустую.

По данным Epoch AI, лидерборд MirrorCode

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Y Combinator открыл код платформы QM: что такое ИИ-агент уровня компании
ai

Y Combinator открыл код платформы QM: что такое ИИ-агент уровня компании

Команда Y Combinator (акселератор, через который прошли Dropbox, Airbnb и тысячи других стартапов) выложила в открытый доступ QM, платформу для мультиагентных…

5 мин
Genspark выложила офисный пакет с ИИ под открытой лицензией: один инженер, $10 000, одна неделя
ai

Genspark выложила офисный пакет с ИИ под открытой лицензией: один инженер, $10 000, одна неделя

Компания Genspark 10 июня опубликовала GenOffice, офисный пакет с ИИ, встроенным в каждый инструмент, и выложила исходный код под свободной лицензией Apache…

5 мин
PerceptionBench проверяет multimodal модели по 10 навыкам зрения: код открыт
ai

PerceptionBench проверяет multimodal модели по 10 навыкам зрения: код открыт

Компания Moonshot AI опубликовала PerceptionBench, открытый бенчмарк для оценки мультимодальных моделей зрения, и выложила полный туториал с кодом, который…

4 мин