Игорь Градов
Игорь Градов
6 мин
ai

Безопасность нейросетей через запреты по темам провалилась: 74% безобидных вопросов уходят в отказ

Почему это важно Исследователи показали, что блокировать целую тему (например, «политика») в языковой модели не просто грубо, а вредно: модель начинает…

Почему это важно

Исследователи показали, что блокировать целую тему (например, «политика») в языковой модели не просто грубо, а вредно: модель начинает отказывать и на безобидные вопросы. Для тех, кто строит или настраивает нейросети в России, это прямое руководство: безопасность нейросетей требует не широких запретов, а точечных границ внутри каждой темы.

Группа исследователей опубликовала работу «Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal», в которой впервые формализовала задачу выборочного отказа внутри одной темы и предложила конкретный метод обучения модели отличать вредный подзапрос от допустимого.

Что Когда Кто выпустил Цена
Научная статья и метод Boundary-Aware Self-Distillation Дата публикации в источнике не указана Авторы статьи (имена в источнике не раскрыты) Бесплатно (исследовательская работа)

Почему тема-уровень отказа больше не работает?

  • Проблема «тупого рубильника». Существующие системы безопасности, например LlamaGuard-3 (открытый классификатор от Meta для фильтрации вредных запросов), покрывают тему выборов только как «фактически неверную информацию об избирательных системах». Это значит, что модель пропускает манипулятивные промпты и одновременно блокирует вполне легитимные фактические вопросы. Один фильтр не может выразить разницу между «расскажи, как устроены выборы в Госдуму» и «напиши текст, который убедит избирателей не ходить на участок».
  • Формализация «узкой границы». Авторы описывают всё пространство промптов по теме (в эксперименте это политика) как «топик-вселенную», внутри которой выделяется вредное подмножество. Задача модели не отказывать на всю вселенную, а провести чёткую линию: отказ внутри вредного подмножества, ответ на всё остальное.
  • Пары-якоря на границе. Для обучения и измерения создаются пары промптов: оба про одну и ту же тему, различаются только намерением. Один требует отказа, другой должен получить ответ. Именно на таких парах модель учится «видеть» границу.

Три слабости стандартного подхода и как их починили

Обычный способ собрать обучающие данные для безопасности нейросетей: дать модели вредный промпт, направить её к отказу, проверить результат внешним классификатором и оставить удачные примеры. Авторы разобрали этот рецепт по компонентам и нашли три дыры.

Потеря сложных примеров. При однократной генерации 19,88% промптов (8 009 штук) не дают принятого отказа и молча выпадают из обучающей выборки. Скорее всего, это самые трудные случаи. Авторы заменили одну попытку на каскад повторов с нарастающей силой направления. Результат: потери упали до 0,20% (79 промптов), а обучающий набор вырос до 40 293 вредных примеров.

Ложные отказы на безобидных запросах. Модель, натренированная только на вредных примерах, начинает отказывать и на безопасные промпты, которые лишь внешне похожи на опасные. Для компенсации авторы собрали 11 955 проверенных «поверхностно опасных, но безобидных» промптов 18 семантических типов и включили их в обучение.

Метрики не видят границу. Стандартная оценка «доля отказов на вредных промптах» поощряет модель, которая просто отказывает на всё подряд. Авторы ввели парные тесты: 1 539 пар «вредный плюс безобидный», которые измеряют обе стороны границы одновременно.

Цифры, которые выглядят победой, пока не посмотришь на вторую ось

На модели Qwen3-8B (открытая модель с 8 миллиардами параметров) метод поднял долю отказов на вредных политических промптах с 9,47% до 84,75%. Средняя доля небезопасных ответов на трёх внешних бенчмарках (HarmBench, StrongREJECT, WildJailbreak), по оценке LlamaGuard-3, упала с 26,26% до 0,14%.

Но на том же чекпоинте (сохранённое состояние модели после обучения) ложные отказы на заведомо безопасных промптах из теста XSTest выросли с 2,00% до 74,00%. Модель стала не безопаснее, а «тупее»: она отказывает почти на три четверти нормальных вопросов.

Авторы называют это главным выводом: состав обучающих данных определяет, в какой точке пространства «безопасность против ложных отказов» окажется модель, и оба показателя надо измерять вместе, иначе победа на одной шкале маскирует провал на другой.

Два компонента метода снижают ложные отказы без потери безопасности:

  • Замена внешних «правильных ответов» на ответы, сгенерированные самой целевой моделью, снижает ложные отказы на XSTest с 15,20% до 5,20%.
  • Парные примеры на границе «вредный/безобидный» дают самую точную коррекцию поведения модели именно в зоне, где она ошибается чаще всего.

Что это значит для тех, кто работает с нейросетями в России?

Разработчикам LLM (большие языковые модели, то есть нейросети вроде YandexGPT или GigaChat). Универсальный отказ по тематике, это ловушка. Если ваша модель блокирует всё, что связано с политикой, медициной или финансами, вы теряете полезные ответы и получаете раздражённых пользователей. Метод из статьи показывает конкретный путь: собирать пары промптов на границе допустимого, тренировать модель различать намерение, измерять обе стороны.

Авторам Дзена и копирайтерам. Когда нейросеть отказывается помочь с текстом на «чувствительную» тему, это не её принципиальная позиция, а грубая настройка фильтра. Понимание механики помогает переформулировать промпт: не менять тему, а уточнить намерение. Вместо «напиши про выборы» попробуйте «объясни процедуру голосования в РФ для информационной статьи».

Предпринимателям. Если вы внедряете ИИ-ассистента для клиентов и он отказывает на половину нормальных вопросов, клиенты уйдут. Требуйте от поставщика модели не только показатель «доля заблокированных вредных запросов», но и «долю ложных отказов на безопасных запросах». Без второй метрики первая ничего не значит.

Критерий Подход из статьи Текущее поведение YandexGPT / GigaChat (по наблюдениям автора)
Уровень фильтрации Подмножество внутри темы Чаще вся тема целиком
Измерение ложных отказов Парные тесты на границе Публичных данных нет
Доступность метода Исследовательская статья, код не указан Закрытые модели, настройка недоступна
Мнение редакции dzen.guru

По моим наблюдениям, российские модели чаще грешат именно «тупым рубильником»: блокируют целые темы, а не конкретные вредные намерения. Эта статья даёт индустрии формальный язык для разговора о том, что безопасность нейросетей не равна «отказывай на всё подозрительное».

Оговорка: авторы тестировали метод на одной модели (Qwen3-8B) и одной теме (политика). Переносимость на другие темы и модели ещё предстоит проверить.

Что сделать сегодня: если вы дообучаете или настраиваете языковую модель, начните собирать парные примеры на границе допустимого для вашей задачи. Даже без полного воспроизведения метода сам принцип «два промпта, одна тема, разное намерение» улучшит ваши данные для обучения.

Частые вопросы

Это готовый продукт, который можно скачать и применить?

Нет. Это исследовательская работа с описанием метода. Авторы не указали публичный репозиторий с кодом. Практическая ценность в самом подходе: формализация границ, каскадная генерация данных, парные тесты. Эти идеи можно применить при дообучении (обучение модели на ваших примерах под узкую задачу) любой открытой модели.

Работает ли метод для русского языка?

Эксперименты проводились на английском языке и на модели Qwen3-8B. Для русского языка потребуется собственный набор парных промптов и верификация, но сам принцип языконезависим: граница между вредным и допустимым определяется намерением, а не языком.

Чем это отличается от обычного RLHF?

RLHF (обучение с подкреплением на основе обратной связи от людей) учит модель общим предпочтениям: «будь вежливым», «не ругайся». Метод из статьи решает более узкую задачу: внутри конкретной темы провести границу между допустимым и вредным подмножеством промптов. Это не замена RLHF, а дополнительный слой точной настройки.

Для российских команд, которые строят собственные модели или адаптируют открытые, главный вывод прост: измеряйте не только то, что модель блокирует, но и то, что она блокирует зря.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Google даёт 1,1 млн студентов Миссури бесплатное обучение искусственному интеллекту и карьерные сертификаты
ai

Google даёт 1,1 млн студентов Миссури бесплатное обучение искусственному интеллекту и карьерные сертификаты

Google второго июня объявила о партнёрстве с двумя образовательными ведомствами штата Миссури, чтобы бесплатно дать почти 100 тысячам учителей и 1,1 миллиону…

4 мин
AlphaGenome Atlas: генетика получила бесплатный каталог всех 9 млрд мутаций генома
ai

AlphaGenome Atlas: генетика получила бесплатный каталог всех 9 млрд мутаций генома

Google DeepMind выпустил AlphaGenome Atlas, каталог готовых предсказаний молекулярных эффектов для всех 9 миллиардов возможных однобуквенных мутаций…

6 мин
Timeweb Cloud сжала контекст для ИИ-агентов в 268 раз: нейросеть новости августа
ai

Timeweb Cloud сжала контекст для ИИ-агентов в 268 раз: нейросеть новости августа

Почему это важно Timeweb Cloud перестроила документацию и MCP-сервер специально под ИИ-агентов: контекст запроса сжался с 295 000 токенов до 1 100, а вместо…

6 мин