Meta FAIR ускорила оптимизацию экспериментов AI в 1,5 раза: модель отсеивает слабых кандидатов до запуска
Команда Meta FAIR совместно с Оксфордским университетом и Университетским колледжем Лондона представила модели предпочтений для ИИ-исследователей (AI Research Preference Models, RPM), которые ранжируют кандидатов-эксперименты до запуска и позволяют достичь того же результата в полтора раза быстрее.

Генерировать идеи для экспериментов дёшево, а проверять их на GPU дорого: один запуск занимает от часов до суток. RPM превращает отбор кандидатов из случайного в управляемый и экономит до трети вычислительного времени без смены оборудования.
Исследование формализует задачу, которая до сих пор решалась интуитивно или случайным выбором. Когда ИИ-агент (программа, которая сама предлагает, пишет код и оценивает машинно-обучающие эксперименты) генерирует десятки кандидатов, кто-то должен решить, какой из них запускать первым. Именно этот выбор, по мнению авторов, и есть настоящий рычаг ускорения исследований. Статья опубликована в открытом доступе, инструменты выложены как опенсорс.
| Показатель | Значение | Источник |
|---|---|---|
| Средний нормализованный балл без RPM | 0,684 | статья Meta FAIR |
| Балл с инференс-RPM | 0,711 | статья Meta FAIR |
| Балл с агентным RPM | 0,729 | статья Meta FAIR |
| Время до уровня базовой линии (инференс-RPM) | 14,88 часа вместо 24 (ускорение в 1,61 раза) | статья Meta FAIR |
| Время до уровня базовой линии (агентный RPM) | 15,50 часа вместо 24 (ускорение в 1,55 раза) | статья Meta FAIR |
| Новый лучший результат WinoGrande | 94,1% (предыдущий агентный рекорд 90,4%) | статья Meta FAIR |
| Новый лучший результат SVAMP | 95,7% (предыдущий рекорд 94,2%) | статья Meta FAIR |
| Число задач в тесте | 20 (текстовые и табличные) | статья Meta FAIR |
| GPU на задачу | 1 x H200, 24 часа | статья Meta FAIR |
| Базовая модель | Qwen3.6-27B (открытые веса) | статья Meta FAIR |
Как устроена оптимизация экспериментов AI?
Представьте, что у вас одна лаборатория и двадцать заявок на опыт. Запускать все подряд слишком долго. Нужен «рецензент», который прочитает план каждого опыта и скажет: «Вот этот самый перспективный, начните с него».
RPM работает именно так. ИИ-агент применяет оператор (генерирует новый вариант эксперимента) не один раз, а пятнадцать раз параллельно. Получается пятнадцать кандидатов, ни один из которых ещё не запущен. Модель сравнивает их попарно в формате «нокаут-турнира» и отправляет на выполнение только победителя.
При сравнении модель видит контекст: узлы уже выполненного «дерева поиска» вместе с полученными оценками. Это важно: RPM никогда не пытается предсказать абсолютный балл. Авторы обнаружили, что языковые модели ненадёжны в прогнозировании точных метрик, поэтому RPM только ранжирует, а не угадывает числа.
Два варианта модели с разным бюджетом
Авторы предложили два варианта RPM. Оба используют «замороженную» (без дообучения) модель Qwen3.6-27B с открытыми весами (open weights, когда параметры модели доступны для скачивания и запуска на своём железе).
Инференс-RPM (инференс, это процесс, когда модель выдаёт ответ, а не обучается). Модель выступает «судьёй»: читает планы кандидатов, их код и историю поиска, затем выбирает лучшего. Промпт (prompt, текстовая инструкция для модели) оптимизирован методом MIPROv2 из фреймворка DSPy. В итоге модель использует «рубрику главного исследователя»: терпит исправимые баги, вознаграждает расширяемость, штрафует за повтор уже проверенных направлений. Точность отбора на офлайн-тестах составила от 57,7% до 59,0%.
Агентный RPM. Тот же «судья» плюс песочница, которая клонирует окружение агента, включая один GPU H200. Модель запускает короткие «пилотные» эксперименты (не более 30 штук, каждый до 60 секунд), а затем решает, нужен ли ещё один пилот или пора выбирать. Любопытная деталь: модели намеренно сообщают завышенный остаток времени (2700 секунд вместо реальных 300), чтобы она не останавливалась раньше времени.
Что обнаружили?
- Качество выросло. Средний нормализованный балл поднялся с 0,684 (без RPM) до 0,711 (инференс-вариант) и 0,729 (агентный вариант) на 20 задачах AIRS-Bench, по данным статьи.
- Скорость выросла заметнее. Инференс-RPM достигает базового результата 0,684 за 14,88 часа вместо 24, то есть быстрее в 1,61 раза. Агентный RPM делает то же за 15,50 часа (быстрее в 1,55 раза). Именно оптимизация экспериментов AI через ранжирование, а не более мощная модель, даёт этот эффект.
- Вероятность улучшения относительно варианта без RPM составляет 0,5923 (инференс) и 0,5913 (агентный), нижняя граница 95%-го доверительного интервала выше 0,50 в обоих случаях.
- Два новых лучших результата на бенчмарках. WinoGrande: 94,1% (агентный RPM) против прежнего агентного рекорда 90,4%. SVAMP: 95,7% (инференс-RPM) против прежнего рекорда 94,2%.
Тест проводился на 20 публичных задачах с текстовыми и табличными данными. Каждая задача запускалась 10 раз (10 сидов) на одном GPU H200 с лимитом 24 часа. Базовая модель одна и та же (Qwen3.6-27B) для генерации и для ранжирования, поэтому прирост объясняется именно слоем отбора, а не более сильным «судьёй». Однако вероятность улучшения 0,59, это скромный, хотя статистически значимый результат: в четырёх случаях из десяти RPM не помогает. Стоит также учесть, что инференс самой RPM добавляет 0,66 часа на запуск, то есть ускорение «в полтора раза» получено уже с учётом этих накладных расходов.
Что это значит для вас?
Исследователям и ML-инженерам. Если ваша команда работает с ограниченным парком GPU (а в России это типичная ситуация), подход RPM предлагает конкретный способ сократить перебор. Код инструмента AIRA-dojo и бенчмарк AIRS-Bench выложены в открытый доступ. Базовая модель Qwen3.6-27B доступна как открытые веса, то есть её можно развернуть локально. Никакого дообучения не требуется: модель используется «как есть».
Авторам Дзена и контент-маркетологам. Прямого применения в контенте у RPM нет, это инструмент для ML-исследований. Но сам принцип «ранжируй идеи до того, как потратишь ресурсы на проверку» переносится на работу с контентом: прогнать десять вариантов заголовка через тест, прежде чем запускать трафик на все десять.
Предпринимателям. Если вы финансируете ML-команду или R&D-подразделение, экономия 35% GPU-времени при сопоставимом качестве, это прямая экономия на вычислительных ресурсах. Инструмент бесплатный, железо остаётся вашим.
Результат выглядит скромно, прирост балла в третьем знаке после запятой, пока не пересчитаешь в часы и деньги. Десять часов H200 по рыночным ценам облачных GPU обходятся в ощутимую сумму, и если каждую задачу можно закрывать за 15 часов вместо 24, экономия складывается в серьёзный бюджет за квартал. Я бы обратил внимание на то, что модель не дообучается: берётся «замороженный» Qwen3.6-27B и работает только за счёт грамотно выстроенного промпта и турнирного отбора. Для небольших российских лабораторий, у которых нет ресурсов на дообучение отдельного «судьи», это самый практичный сценарий.
Код и бенчмарк доступны прямо сейчас: если ваша команда уже использует агентный подход к ML-экспериментам, добавить слой ранжирования можно без смены инфраструктуры, а выигрыш в полтора раза по времени окупит день на интеграцию.
По данным Marktechpost.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Вред переживаний ИИ: избыточные рассуждения Qwen3.8 ухудшают код вместо улучшения
Нейросеть Qwen3.8-27B на Mac Studio второго июня 2025 года прошла локальный бенчмарк из 84 задач на C# и SwiftUI, и квантизованная (сжатая) 4-bit версия…

Google и Cathay Pacific снизили тепловой след авиации на 40%: что значит для авиации и окружающей среды
Google и Cathay Pacific провели первые в Азии лётные испытания ИИ-системы, которая прокладывает маршруты в обход зон образования инверсионных следов, и на…
Токеномика нейросетей получила свой Big-O: Linux Foundation учит считать расходы на токены
Под крылом Linux Foundation появилось новое направление, Tokenomics Foundation, и его первый проект уже позволяет оценить, во сколько на самом деле обходятся…
Комментарии