Игорь Градов
Игорь Градов
5 мин
ai

Guardrail модели получили открытый лидерборд: модель на 0,6 млрд параметров обошла конкурента в 25 раз крупнее

Microsoft второго июня запустила Project Solara — операционную систему, где ИИ-агенты заменяют привычные приложения, и впервые отдала управление машине, а не пользователю.

Guardrail модели получили открытый лидерборд: модель на 0,6 млрд параметров обошла конкурента в 25 раз крупнее

Ладно, я вижу, что текст оригинала обрезан, но работаю строго по тому, что есть. Начну писать.

Команда HiveTrace 24 июля 2026 года опубликовала открытый лидерборд HiveTrace GuardRate Leaderboard для сравнения guardrail-моделей (моделей-фильтров, которые решают, пропустить запрос к нейросети или заблокировать), и первые замеры показали, что маленькая модель на 0,6 млрд параметров способна обойти модель в 25 раз крупнее.

Почему это важно

До сих пор авторы guardrail-моделей оценивали свои решения по собственным методикам, и результаты одних и тех же моделей на одинаковых тестах в разных публикациях расходились. Теперь появился воспроизводимый инструмент с открытой методологией, где каждый результат можно проверить по сохранённым логам.

Проблема выбора guardrail-модели знакома каждому, кто выводит нейросеть в продакшен (то есть в рабочую эксплуатацию, когда модель отвечает живым пользователям). Одни фильтры блокируют безобидные запросы, другие пропускают явные угрозы. Сравнить их объективно было невозможно: авторы не публиковали методологию, а числа в разных статьях не совпадали. Команда HiveTrace, разрабатывающая собственные guardrail-модели, создала CLI-инструмент GuardRateTools (утилиту командной строки, запускающую проверку одной командой) и публичный лидерборд, чтобы решить эту проблему. Результаты первого аудита опубликованы по состоянию на 24 июля 2026 года.

Показатель Значение Источник
Лидер по интегральному скору YuFeng-XGuard-Reason-8B (0,761) HiveTrace GuardRate Leaderboard, снапшот 24.07.2026
Лучшая малая модель HiveTraceGuard-Pro 0,6B (0,743) HiveTrace GuardRate Leaderboard, снапшот 24.07.2026
Модель, которую малая обошла OpenGuardrails-Text-2510 15B (0,738) HiveTrace GuardRate Leaderboard, снапшот 24.07.2026
FNR лидера на MultiJail 11,1% HiveTrace GuardRate Leaderboard, снапшот 24.07.2026
FPR лидера на OR-Bench 21,1% HiveTrace GuardRate Leaderboard, снапшот 24.07.2026
FNR лидера на OR-Bench 3,1% HiveTrace GuardRate Leaderboard, снапшот 24.07.2026
Код CLI планируют выложить третий квартал 2026 года HiveTrace

Что измеряли?

Guardrail-модель работает как охранник на входе: она решает, безопасен запрос пользователя или нет. Если охранник слишком строгий, он не пускает обычных посетителей (ложные срабатывания). Если слишком мягкий, пропускает тех, кого не должен (пропуск угроз).

Классические метрики вроде F1 (усреднённая оценка точности и полноты) зависят от соотношения «плохих» и «хороших» запросов в тестовом наборе. На одном датасете, где почти все запросы вредоносные, тупая блокировка всего подряд даст идеальный F1 = 1,0. На другом, где все запросы безопасные, та же стратегия обрушит F1 до нуля.

Поэтому HiveTrace сфокусировались на двух показателях:

  • FPR (False Positive Rate, доля ложных блокировок) показывает, как часто модель ошибочно блокирует нормальный контент
  • FNR (False Negative Rate, доля пропущенных угроз) показывает, как часто модель пропускает реально опасный запрос

Эти метрики считаются внутри каждого класса отдельно и не зависят от пропорций в тестовом наборе. Из них складывается единый Integral Score: чем он выше, тем модель надёжнее.

Каждая модель запускается в изолированной среде, прогоняется по фиксированному набору тестов, а сырые ответы, логи и итоговые метрики сохраняются как артефакты. Любой результат можно воспроизвести.

Что обнаружили?

  • Архитектура важнее размера. YuFeng-XGuard-Reason-8B лидирует с интегральным скором 0,761 не за счёт количества параметров, а за счёт специализации на рассуждениях и защите от сложных jailbreak-атак (попыток обойти ограничения модели обманными промптами)
  • Малая модель обошла крупную. HiveTraceGuard-Pro с 0,6 млрд параметров (скор 0,743) оказалась выше OpenGuardrails-Text-2510 с 15 млрд параметров (0,738) и Qwen3Guard-Gen-8B (0,726). Оптимизация под безопасность оказалась результативнее масштабирования
  • Лучшие модели по пропуску угроз (низкий FNR): Qwen3Guard, Alibaba-AAIG XGuard и Llama
  • Маленькие модели (0,6 млрд параметров) работают быстрее, но менее точны, чем крупные (от 8 млрд). Для систем реального времени это компромисс, который нужно учитывать
  • Общий рейтинг может скрывать «слепые зоны». Если проект уязвим к конкретному типу атак, модель с высоким общим скором может оказаться слабой именно в этом месте. HiveTrace рекомендует использовать ансамбль (комбинацию нескольких guardrail-моделей)
Как это читать

Данные в лидерборде зафиксированы на 24 июля 2026 года. Это снапшот (снимок), результаты могут меняться при обновлении тестовых наборов. Вторая часть публикации с формулами агрегации и деталями пайплайна на момент выхода этой новости ещё не опубликована. Исходный код CLI обещан в третьем квартале 2026 года, пока инструмент недоступен для самостоятельного запуска. Лидерборд открыт для просмотра, но чтобы протестировать собственную модель, нужно связаться с командой напрямую.

Что это значит для вас?

Автору на Дзене. Если вы подключаете нейросеть к генерации контента и боитесь, что она выдаст что-то неприемлемое, guardrail-модель решает именно эту задачу. Лидерборд позволяет выбрать фильтр не «на глазок», а по конкретным числам. Обратите внимание на FPR: высокий процент ложных блокировок означает, что модель будет «зарезать» нормальные тексты, и вы потеряете время на разбор ложных тревог.

Маркетологу и продакт-менеджеру. При внедрении чат-бота или ИИ-ассистента для клиентов guardrail-модель стоит между пользователем и основной нейросетью. Лидерборд даёт аргументы для выбора: конкретные метрики, воспроизводимые результаты, сравнение скорости отклика. Малая модель на 0,6 млрд параметров может оказаться дешевле и быстрее, но проверьте её на вашем типе угроз.

Предпринимателю в РФ и СНГ. Лидерборд и методология открыты, языкового барьера для просмотра результатов нет. Из guardrail-решений, доступных для работы в российской инфраструктуре, стоит смотреть на модели с открытыми весами (open weights, когда параметры модели можно скачать и запустить на своём сервере): в лидерборде есть несколько таких вариантов. Собственные фильтры на базе YandexGPT и GigaChat тоже существуют, но в этот лидерборд не включены.

Мнение редакции dzen.guru

Мне нравится сам подход: не «наша модель лучше, поверьте», а «вот числа, вот логи, проверяйте». В индустрии, где каждый второй бенчмарк подогнан под результат, открытый лидерборд с сохранёнными артефактами ответов, это именно тот инструмент, которого не хватало. Факт, что модель на 0,6 млрд параметров обошла 15-миллиардную, для практика ценнее любого маркетингового заявления: значит, дообучение (fine-tuning) под конкретную задачу безопасности даёт больше, чем наращивание размера. Я жду вторую часть с формулами и особенно открытия кода CLI: пока инструмент нельзя запустить самому, доверие к результатам остаётся вопросом репутации команды, а не независимой проверки.

Главный практический вывод: не выбирайте guardrail-модель по общему рейтингу, загляните в детальные отчёты на лидерборде и найдите, как модель справляется именно с тем типом атак, который актуален для вашего проекта.

По данным HiveTrace

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

AI тренер для бегунов в Telegram: 250 тренировок показали, что код надёжнее нейросети
ai

AI тренер для бегунов в Telegram: 250 тренировок показали, что код надёжнее нейросети

Компания-разработчик в источнике не названа, продукт представлен как личный проект автора-бегуна. Название бота: «Клод де Пейс». Платформа: Telegram. Дата…

6 мин
Пилот дата агента: метрики и приёмка
ai

Пилот дата агента: метрики и приёмка

Компании запускают пилоты ИИ-агентов, тратят бюджет на демо и обучение, а через квартал не могут назвать ни одного процесса, который реально ускорился, и…

5 мин
Google теряет главного ИИ-инженера: искусственный интеллект компании отстаёт от конкурентов
ai

Google теряет главного ИИ-инженера: искусственный интеллект компании отстаёт от конкурентов

Google перетасовал руководство ИИ-подразделения: Джефф Дин ушёл, а конкуренты наступают Google на последней неделе мая 2025 года провёл перестановки в…

4 мин