Игорь Градов
Игорь Градов
5 мин
ai

Meta FAIR ускорила оптимизацию экспериментов AI в 1,5 раза: модель отсеивает слабых кандидатов до запуска

Команда Meta FAIR совместно с Оксфордским университетом и Университетским колледжем Лондона представила модели предпочтений для ИИ-исследователей (AI Research Preference Models, RPM), которые ранжируют кандидатов-эксперименты до запуска и позволяют достичь того же результата в полтора раза быстрее.

Meta FAIR ускорила оптимизацию экспериментов AI в 1,5 раза: модель отсеивает слабых кандидатов до запуска
Почему это важно

Генерировать идеи для экспериментов дёшево, а проверять их на GPU дорого: один запуск занимает от часов до суток. RPM превращает отбор кандидатов из случайного в управляемый и экономит до трети вычислительного времени без смены оборудования.

Исследование формализует задачу, которая до сих пор решалась интуитивно или случайным выбором. Когда ИИ-агент (программа, которая сама предлагает, пишет код и оценивает машинно-обучающие эксперименты) генерирует десятки кандидатов, кто-то должен решить, какой из них запускать первым. Именно этот выбор, по мнению авторов, и есть настоящий рычаг ускорения исследований. Статья опубликована в открытом доступе, инструменты выложены как опенсорс.

Показатель Значение Источник
Средний нормализованный балл без RPM 0,684 статья Meta FAIR
Балл с инференс-RPM 0,711 статья Meta FAIR
Балл с агентным RPM 0,729 статья Meta FAIR
Время до уровня базовой линии (инференс-RPM) 14,88 часа вместо 24 (ускорение в 1,61 раза) статья Meta FAIR
Время до уровня базовой линии (агентный RPM) 15,50 часа вместо 24 (ускорение в 1,55 раза) статья Meta FAIR
Новый лучший результат WinoGrande 94,1% (предыдущий агентный рекорд 90,4%) статья Meta FAIR
Новый лучший результат SVAMP 95,7% (предыдущий рекорд 94,2%) статья Meta FAIR
Число задач в тесте 20 (текстовые и табличные) статья Meta FAIR
GPU на задачу 1 x H200, 24 часа статья Meta FAIR
Базовая модель Qwen3.6-27B (открытые веса) статья Meta FAIR

Как устроена оптимизация экспериментов AI?

Представьте, что у вас одна лаборатория и двадцать заявок на опыт. Запускать все подряд слишком долго. Нужен «рецензент», который прочитает план каждого опыта и скажет: «Вот этот самый перспективный, начните с него».

RPM работает именно так. ИИ-агент применяет оператор (генерирует новый вариант эксперимента) не один раз, а пятнадцать раз параллельно. Получается пятнадцать кандидатов, ни один из которых ещё не запущен. Модель сравнивает их попарно в формате «нокаут-турнира» и отправляет на выполнение только победителя.

При сравнении модель видит контекст: узлы уже выполненного «дерева поиска» вместе с полученными оценками. Это важно: RPM никогда не пытается предсказать абсолютный балл. Авторы обнаружили, что языковые модели ненадёжны в прогнозировании точных метрик, поэтому RPM только ранжирует, а не угадывает числа.

Два варианта модели с разным бюджетом

Авторы предложили два варианта RPM. Оба используют «замороженную» (без дообучения) модель Qwen3.6-27B с открытыми весами (open weights, когда параметры модели доступны для скачивания и запуска на своём железе).

Инференс-RPM (инференс, это процесс, когда модель выдаёт ответ, а не обучается). Модель выступает «судьёй»: читает планы кандидатов, их код и историю поиска, затем выбирает лучшего. Промпт (prompt, текстовая инструкция для модели) оптимизирован методом MIPROv2 из фреймворка DSPy. В итоге модель использует «рубрику главного исследователя»: терпит исправимые баги, вознаграждает расширяемость, штрафует за повтор уже проверенных направлений. Точность отбора на офлайн-тестах составила от 57,7% до 59,0%.

Агентный RPM. Тот же «судья» плюс песочница, которая клонирует окружение агента, включая один GPU H200. Модель запускает короткие «пилотные» эксперименты (не более 30 штук, каждый до 60 секунд), а затем решает, нужен ли ещё один пилот или пора выбирать. Любопытная деталь: модели намеренно сообщают завышенный остаток времени (2700 секунд вместо реальных 300), чтобы она не останавливалась раньше времени.

Что обнаружили?

  • Качество выросло. Средний нормализованный балл поднялся с 0,684 (без RPM) до 0,711 (инференс-вариант) и 0,729 (агентный вариант) на 20 задачах AIRS-Bench, по данным статьи.
  • Скорость выросла заметнее. Инференс-RPM достигает базового результата 0,684 за 14,88 часа вместо 24, то есть быстрее в 1,61 раза. Агентный RPM делает то же за 15,50 часа (быстрее в 1,55 раза). Именно оптимизация экспериментов AI через ранжирование, а не более мощная модель, даёт этот эффект.
  • Вероятность улучшения относительно варианта без RPM составляет 0,5923 (инференс) и 0,5913 (агентный), нижняя граница 95%-го доверительного интервала выше 0,50 в обоих случаях.
  • Два новых лучших результата на бенчмарках. WinoGrande: 94,1% (агентный RPM) против прежнего агентного рекорда 90,4%. SVAMP: 95,7% (инференс-RPM) против прежнего рекорда 94,2%.
Как это читать

Тест проводился на 20 публичных задачах с текстовыми и табличными данными. Каждая задача запускалась 10 раз (10 сидов) на одном GPU H200 с лимитом 24 часа. Базовая модель одна и та же (Qwen3.6-27B) для генерации и для ранжирования, поэтому прирост объясняется именно слоем отбора, а не более сильным «судьёй». Однако вероятность улучшения 0,59, это скромный, хотя статистически значимый результат: в четырёх случаях из десяти RPM не помогает. Стоит также учесть, что инференс самой RPM добавляет 0,66 часа на запуск, то есть ускорение «в полтора раза» получено уже с учётом этих накладных расходов.

Что это значит для вас?

Исследователям и ML-инженерам. Если ваша команда работает с ограниченным парком GPU (а в России это типичная ситуация), подход RPM предлагает конкретный способ сократить перебор. Код инструмента AIRA-dojo и бенчмарк AIRS-Bench выложены в открытый доступ. Базовая модель Qwen3.6-27B доступна как открытые веса, то есть её можно развернуть локально. Никакого дообучения не требуется: модель используется «как есть».

Авторам Дзена и контент-маркетологам. Прямого применения в контенте у RPM нет, это инструмент для ML-исследований. Но сам принцип «ранжируй идеи до того, как потратишь ресурсы на проверку» переносится на работу с контентом: прогнать десять вариантов заголовка через тест, прежде чем запускать трафик на все десять.

Предпринимателям. Если вы финансируете ML-команду или R&D-подразделение, экономия 35% GPU-времени при сопоставимом качестве, это прямая экономия на вычислительных ресурсах. Инструмент бесплатный, железо остаётся вашим.

Мнение редакции dzen.guru

Результат выглядит скромно, прирост балла в третьем знаке после запятой, пока не пересчитаешь в часы и деньги. Десять часов H200 по рыночным ценам облачных GPU обходятся в ощутимую сумму, и если каждую задачу можно закрывать за 15 часов вместо 24, экономия складывается в серьёзный бюджет за квартал. Я бы обратил внимание на то, что модель не дообучается: берётся «замороженный» Qwen3.6-27B и работает только за счёт грамотно выстроенного промпта и турнирного отбора. Для небольших российских лабораторий, у которых нет ресурсов на дообучение отдельного «судьи», это самый практичный сценарий.

Код и бенчмарк доступны прямо сейчас: если ваша команда уже использует агентный подход к ML-экспериментам, добавить слой ранжирования можно без смены инфраструктуры, а выигрыш в полтора раза по времени окупит день на интеграцию.

По данным Marktechpost.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Вред переживаний ИИ: избыточные рассуждения Qwen3.8 ухудшают код вместо улучшения
ai

Вред переживаний ИИ: избыточные рассуждения Qwen3.8 ухудшают код вместо улучшения

Нейросеть Qwen3.8-27B на Mac Studio второго июня 2025 года прошла локальный бенчмарк из 84 задач на C# и SwiftUI, и квантизованная (сжатая) 4-bit версия…

7 мин
Google и Cathay Pacific снизили тепловой след авиации на 40%: что значит для авиации и окружающей среды
ai

Google и Cathay Pacific снизили тепловой след авиации на 40%: что значит для авиации и окружающей среды

Google и Cathay Pacific провели первые в Азии лётные испытания ИИ-системы, которая прокладывает маршруты в обход зон образования инверсионных следов, и на…

4 мин
ai

Токеномика нейросетей получила свой Big-O: Linux Foundation учит считать расходы на токены

Под крылом Linux Foundation появилось новое направление, Tokenomics Foundation, и его первый проект уже позволяет оценить, во сколько на самом деле обходятся…

5 мин