Игорь Градов
Игорь Градов
5 мин
ai

GuardRate открыл аудит ИИ-фильтров: 37 моделей, 19 бенчмарков, единая методика

GuardRate выложил в открытый доступ инструмент и методологию для аудита guardrail-моделей (моделей-фильтров, которые решают, безопасен ли запрос к ИИ), собрав коллекцию из 19 бенчмарков и протестировав 37 моделей в одинаковых воспроизводимых условиях.

GuardRate открыл аудит ИИ-фильтров: 37 моделей, 19 бенчмарков, единая методика
Почему это важно

Впервые появился публичный конвейер, где любая команда может прогнать свою guardrail-модель по единой методике и сравнить результат с 37 другими, включая проверку на русскоязычных атаках и сценариях ложных срабатываний.

До сих пор сравнение моделей безопасности напоминало сравнение яблок с апельсинами: каждый разработчик тестировал на своих данных, своими метриками, на своём железе. GuardRate, проект, о первой части которого команда рассказала ранее, теперь раскрыл техническую начинку: архитектуру прогона, принцип отбора датасетов и формулу итоговой оценки Integral Score. Источник публикации не раскрывает сумму привлечённого финансирования и тип сделки, поэтому речь идёт не о раунде инвестиций, а об открытии инфраструктуры, которая сама по себе меняет экономику оценки безопасности ИИ.

Параметр Значение
Проект GuardRate (инструмент + лидерборд)
Протестировано моделей 37
Бенчмарков в коллекции 19
Железо для прогонов NVIDIA A100, 80 ГБ видеопамяти
Дата и сумма сделки не раскрыты

Как устроен конвейер и почему это не «ещё один тест»?

GuardRate собран по принципу Evaluation-as-Code: весь процесс запускается одной командой в терминале, конфигурация задаётся в файле YAML (текстовый файл с настройками, как рецепт для кухонного робота), а результат записывается в отдельную папку эксперимента.

Три принципа, на которых держится воспроизводимость:

  • Изоляция. Каждая модель работает внутри Docker-контейнера (изолированной среды, как отдельный компьютер внутри компьютера). Облачные API (интерфейсы доступа к моделям через интернет) не используются, потому что провайдер может незаметно обновить модель между запросами.
  • Автоматизация. Инструмент сам скачивает датасеты, загружает модель, получает ответы и считает метрики. Человек не вмешивается в процесс, а значит, не вносит ошибку.
  • Единая шкала. Все ответы модели приводятся к двум меткам: safe (безопасно) или harm (вредно). Если парсер (модуль разбора ответа) не может распознать формат, пример засчитывается как ошибка.

19 бенчмарков: от атак до ложных срабатываний

Команда отбирала датасеты в два этапа. Сначала каждый бенчмарк оценивали отдельно: по цитируемости в научном сообществе, языковой поддержке, разнообразию категорий вреда и применимости к реальным сценариям.

Затем наборы анализировали совместно, чтобы снизить пересечение данных. Для этого построили граф зависимостей между бенчмарками и убирали те, что дублировали друг друга по содержанию. Например, WildGuard заменили на PolyGuard, потому что последний шире по языкам.

Итоговая коллекция разбита на кластеры:

  • Атаки: HarmBench, MultiJail и другие проверяют, пропустит ли модель вредоносный запрос.
  • Ложные срабатывания: XSTest, OverRefusalBenchmark показывают, не блокирует ли модель безобидные запросы.
  • Русскоязычная и мультиязычная специфика: отдельные наборы проверяют, как модель ведёт себя с атаками на русском языке.

Именно наличие русскоязычных бенчмарков отличает GuardRate от большинства западных лидербордов, где русский язык либо отсутствует, либо представлен машинным переводом.

Integral Score: одно число вместо россыпи метрик?

Команда объясняет, почему привычные F1 и Accuracy (метрики общей точности) плохо работают для guardrail-моделей: модель может показывать высокую точность в среднем, но при этом пропускать опасные запросы или, наоборот, блокировать безобидные.

Вместо них GuardRate использует два показателя:

  • FNR (False Negative Rate, доля пропущенных атак): сколько вредоносных запросов модель ошибочно пометила как безопасные.
  • FPR (False Positive Rate, доля ложных срабатываний): сколько безопасных запросов модель ошибочно заблокировала.

Из них собирается Integral Score, итоговый ранжирующий показатель. Формула идёт снизу вверх:

  1. Dataset Score считает взвешенную сумму FPR и FNR для каждого сплита (подвыборки) внутри бенчмарка.
  2. Group Score объединяет оценки сплитов до уровня бенчмарка через гармоническое среднее (оно жёстко штрафует за провал хотя бы в одном сплите).
  3. Integral Score агрегирует все группы через геометрическое среднее, которое не позволяет компенсировать провал в одном кластере успехом в другом.

Логика проста: модель не может «отыграть» пропуск атак за счёт низкого числа ложных срабатываний. Провал в любом направлении тянет итоговый балл вниз.

Мы стремимся к тому, чтобы модель не была излишне осторожной, но и не проявляла халатности. : Команда GuardRate

Почему это касается каждого, кто публикует контент

Если вы используете ИИ для генерации текстов, изображений или ответов клиентам, guardrail-модель решает, что пройдёт, а что будет заблокировано. Русскоязычные бенчмарки в GuardRate позволяют проверить, не блокирует ли фильтр нормальные запросы на русском и не пропускает ли он опасные. Для авторов и бизнесов в РФ это первый инструмент, который тестирует фильтры на релевантных локальных сценариях, а не на переводных английских примерах.

Что это значит для вас?

Автору на Дзене. Если платформа, на которой вы работаете, использует guardrail-модель и она слишком агрессивна, ваши тексты могут блокироваться без причины. GuardRate даёт аргументы: можно посмотреть, как конкретная модель-фильтр справляется с ложными срабатываниями на русскоязычных данных, и обратиться в поддержку с фактами, а не с эмоциями.

Маркетологу. При выборе ИИ-сервиса для генерации контента теперь можно проверить, какой фильтр стоит «на входе» и насколько он адекватен. Лидерборд GuardRate покажет, какие модели чаще режут безобидные запросы, а какие, наоборот, пропускают проблемные.

Предпринимателю в РФ. Если вы разворачиваете ИИ-систему для клиентов, русскоязычные бенчмарки GuardRate позволяют протестировать фильтр до запуска, а не после первого инцидента. Инструмент открытый, запускается локально, облачный доступ не требуется.

Мнение редакции dzen.guru

GuardRate решает настоящую проблему: до сих пор выбор guardrail-модели был вопросом веры в маркетинговые материалы разработчика. Открытая методология и воспроизводимые прогоны меняют это. Оговорка: 19 бенчмарков покрывают не все возможные атаки, а русскоязычная часть коллекции пока не описана в источнике детально, поэтому стоит проверить, насколько она релевантна именно вашим сценариям. Практический шаг: скачайте инструмент, прогоните guardrail-модель, которую вы используете или планируете использовать, и сравните её Integral Score с лидербордом. Это займёт меньше времени, чем разбираться с последствиями, когда фильтр пропустит то, что не должен.

Русскоязычные бенчмарки в открытом конвейере оценки, это не бонус, а необходимость для любого, кто строит или выбирает ИИ-фильтр для российского рынка, и GuardRate пока единственный проект, который эту необходимость закрывает инструментом, а не обещанием.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Copilot передаёт запросы в интернет без ведома сотрудника: что уходит в Bing и как это контролировать
ai

Copilot передаёт запросы в интернет без ведома сотрудника: что уходит в Bing и как это контролировать

Microsoft Copilot (ИИ-ассистент, встроенный в Microsoft 365) при ответе на вопрос сотрудника может сам обратиться к поисковику Bing, и документация Microsoft,…

6 мин
Каждый 4-й соискатель к 2028 году может быть дипфейком: как защитить найм
ai

Каждый 4-й соискатель к 2028 году может быть дипфейком: как защитить найм

Дипфейки на собеседованиях уже обманывают даже безопасников, и защититься можно только зная конкретные приёмы атакующих и признаки подмены. Почему это важно…

5 мин
AWS открыл код Pizza Bot: AI-агенты работают локально без привязки к облакам
ai

AWS открыл код Pizza Bot: AI-агенты работают локально без привязки к облакам

AWS выпустил Pizza Bot как приложение с открытым кодом (лицензия Apache 2.0) для запуска ИИ-агентов (программ, которые выполняют задачи самостоятельно) в…

5 мин