Игорь Градов
Игорь Градов
5 мин
ai

MERA запустила первый лидерборд для reasoning моделей на русском языке

Мне дан очень длинный оригинал, но он обрывается. Также: заголовок и архетип говорят "funding", но в оригинале нет никакого раунда финансирования. Оригинал описывает запуск лидерборда MERA Reason для оценки reasoning-моделей на русском языке. Нет суммы сделки, нет инвесторов. Мне нужно адаптировать план секций к фактическому содержанию, не выдумывая финансовых данных.

MERA запустила первый лидерборд для reasoning моделей на русском языке

Поскольку в оригинале нет данных о финансировании, я не могу построить таблицу «Сделка в цифрах» — это было бы выдумкой. Я должен написать новость о запуске лидерборда MERA TEXT (MERA Reason) и его значении. Уберу таблицу сделки, адаптирую секции к реальному содержанию.

Давайте напишем новость строго по фактам из оригинала.

Компания MERA запустила первый публичный лидерборд для оценки рассуждающих моделей на русском языке, и это закрывает пробел, который мешал объективно сравнивать ИИ в задачах на логику вне английского.

Почему это важно

До сих пор сравнить, как рассуждающие модели справляются с задачами именно на русском языке, было практически невозможно: все крупные бенчмарки (AIME, GSM8K, OlymMATH) работают только с английским.

Платформа MERA TEXT, которую команда проекта называет превью большого обновления, стала первой открытой площадкой, где можно сопоставить reasoning-модели (рассуждающие модели, те, что строят длинные цепочки логических шагов, а не просто воспроизводят заученные ответы) в едином воспроизводимом окружении на русском языке. Об этом сообщила команда MERA в публикации на своей платформе.

Почему математика стала главным тестом для рассуждающих моделей?

За последний год фокус индустрии сместился. Если раньше модели соревновались в знаниях, то теперь производители делают ставку на способность рассуждать: строить длинные цепочки шагов, решать задачи в условиях неопределённости, удерживать десятки промежуточных выводов.

Но измерить «умение рассуждать» сложнее, чем проверить знание фактов. Хороший тест должен одновременно требовать последовательных рассуждений, давать объективно проверяемый ответ и позволять воспроизводимое сравнение моделей между собой. Математические задачи отвечают всем трём условиям, поэтому стали основным инструментом оценки.

При этом авторы лидерборда подчёркивают: рассуждение не сводится к математике. Просто математика позволяет проверить цепочку логики без привлечения человека-эксперта на каждый ответ.

Четыре набора задач вместо одного

Один датасет (набор данных для тестирования) не способен покрыть все грани рассуждения. Поэтому лидерборд объединяет четыре разных набора.

Luzitania собран на основе регламента соревнования AIMO3 на платформе Kaggle. В набор вошла 251 задача уровня между Всероссийской олимпиадой и Международной математической олимпиадой (IMO). Источники подбирались намеренно не из англоязычных публикаций: Румынская олимпиада, Китайская олимпиада для девочек, 30 задач из Турнира городов разных лет.

Дополнительно включены задачи из датасетов MathArena и MathArxiv по продвинутой абстрактной математике, выходящей за пределы школьной олимпиадной программы.

Все задачи переведены на русский и частично переформулированы, чтобы модель не могла воспроизвести решение, заученное на этапе предобучения (первичного обучения модели на больших массивах текстов).

Как отбирали задачи?

Фильтр жёсткий. Задача проходила в набор, только если модель GPT-OSS-120B в агентском режиме (с возможностью генерировать и выполнять код на Python) решала её не чаще чем в половине попыток при максимальных настройках. Правильное решение должно было занимать не менее 10 000 токенов (токен, минимальная единица текста, которую обрабатывает модель, примерно три четверти слова), включая код. На каждую задачу запускали по четыре попытки в агентском и четыре в обычном режиме.

Такой фильтр гарантирует, что задачи остаются трудными даже для моделей, специально обученных математическому рассуждению.

Что проверяет лидерборд?

Luzitania оценивает четыре навыка рассуждающей модели:

  • Способность строить длинные цепочки рассуждений.
  • Умение выбирать стратегию решения, а не подставлять шаблон.
  • Устойчивость при большом количестве промежуточных шагов.
  • Способность использовать инструменты (например, код) там, где они помогают, и не полагаться на них механически.
Почему это важно

Для англоязычных моделей давно существуют десятки бенчмарков: AIME, GSM8K, OlymMATH, MiniF2F. Для русского языка подобных открытых площадок до сих пор почти не было, и объективно сравнить reasoning-модели между собой в воспроизводимых условиях было нельзя. MERA TEXT закрывает этот пробел.

Что это значит для вас?

Автору на Дзене. Если вы используете рассуждающие модели для подготовки аналитических материалов, проверки фактов или генерации сложных текстов, теперь есть открытая таблица, где видно, какая модель действительно рассуждает на русском, а какая имитирует рассуждение. Перед выбором инструмента загляните в лидерборд MERA TEXT.

Маркетологу. Результаты лидерборда покажут, насколько модели справляются с логикой именно на русском языке. Это важно при выборе модели для автоматизации задач, где нужен не пересказ, а вывод: расчёт юнит-экономики, анализ данных, построение аргументации.

Предпринимателю в РФ. Лидерборд открытый и бесплатный. Полное обновление платформы MERA команда планирует выпустить летом 2025 года. Из доступных в России рассуждающих моделей на русском можно проверять YandexGPT и GigaChat, но до появления их результатов на этом лидерборде объективного сравнения с западными аналогами не было.

Мнение редакции dzen.guru

Запуск лидерборда для русского языка, событие, которое легко пропустить за шумом очередных релизов. Но именно отсутствие такой площадки позволяло каждому производителю модели заявлять о «лучшем рассуждении» без возможности проверки. Теперь проверка есть, и она публичная. Я жду, когда на лидерборде появятся результаты российских моделей: только тогда можно будет говорить предметно, а не пересказывать маркетинговые презентации. Пока же рекомендую добавить MERA TEXT в закладки и сверяться с ним при выборе модели для задач, где нужна логика, а не просто гладкий текст.

Лидерборд уже доступен, а полная версия обновлённой платформы выйдет летом. Если вы выбираете модель для работы с русским языком и вам важна не гладкость ответа, а качество рассуждения, это первый инструмент, который даёт объективную картину.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

95% находок ИИ-агентов в багбаунти оказываются мусором: трёхслойная верификация спасает рейтинг
ai

95% находок ИИ-агентов в багбаунти оказываются мусором: трёхслойная верификация спасает рейтинг

Дочитав оригинал, приступаю к тексту. ИИ-агенты (программы, которые сами выполняют цепочки действий без участия человека) в багбаунти генерируют десятки…

7 мин
Дженсен Хуанг собрал 35 компаний против закрытого ИИ: Anthropic и Google не подписались
ai

Дженсен Хуанг собрал 35 компаний против закрытого ИИ: Anthropic и Google не подписались

Дженсен Хуанг 24 июля опубликовал свой первый пост в X, и это оказалось не селфи с кожаной курткой, а открытое письмо 35 компаний в защиту моделей с открытыми…

6 мин
Какие новые функции получил ChatGPT от OpenAI: клавиатура Micro за $230 разозлила программистов
ai

Какие новые функции получил ChatGPT от OpenAI: клавиатура Micro за $230 разозлила программистов

ChatGPT получил не софтверное обновление, а первое в истории OpenAI физическое устройство: клавиатурный блок Micro за 230 долларов, разработанный совместно с…

4 мин