Игорь Градов
Игорь Градов
6 мин
ai

Кибербезопасность и искусственный интеллект: урок цифры о том, почему фильтры ИИ не защищают

Компании, создающие большие языковые модели (LLM, программы, которые генерируют текст и ведут диалог), обучают их отказывать на опасные запросы, но механизмы отказа остаются вероятностными фильтрами, а не надёжной защитой, и уже сейчас становятся инструментом контроля над тем, что пользователям можно и нельзя узнать.

Почему это важно

Отказ ИИ выполнять вредный запрос выглядит как гарантия безопасности, но по сути это негласное решение корпораций о том, где проходит граница допустимой речи: формулы нет, критерии закрыты, а те же механизмы уже позволяют блокировать легитимные вопросы и могут использоваться авторитарными правительствами для цензуры.

Расследование MIT Technology Review описывает, как устроена система отказов в современных чат-ботах и почему доверие к ней опасно переоценивать. Статья опирается на интервью с бывшими и действующими сотрудниками OpenAI, исследователями Гарварда и членами совета директоров OpenAI. Проблема касается каждого, кто использует ИИ-инструменты для работы с контентом, включая тех, кто изучает тему «кибербезопасность и искусственный интеллект» на практике.

Что Когда Кто описал Цена
Расследование о механизмах отказа в LLM и рисках их использования как инструмента контроля Июнь 2025 MIT Technology Review Бесплатный доступ к статье

Как модели учатся говорить «нет»?

  • Без обучения модель не умеет отказывать. Стивен Адлер, работавший в отделе безопасности OpenAI с 2020 по 2024 год, рассказал MIT Technology Review, что ранние модели компании «болтали обо всём подряд». Райан Макбейн, исследователь ИИ и психического здоровья в Гарварде, подтвердил: ранние чат-боты без затруднений генерировали инструкции по самоповреждению.

  • Отказ прививается отдельно. Модели проходят серию упражнений: их поощряют за отказ на вредные промпты (промпт, текстовый запрос к модели) и наказывают за «избыточный отказ» на безобидные. Часто одни модели обучают другие, ИИ учит ИИ говорить «нет». Дополнительно компании ставят перед основной моделью слои другого ИИ, которые перехватывают опасные запросы до того, как они дойдут до ядра.

  • Механизм остаётся вероятностным. Отказ срабатывает, когда запрос пользователя статистически похож на один из заранее размеченных вредных примеров. Это не логическое правило, а вероятностное совпадение, поэтому фильтр регулярно даёт сбои в обе стороны: пропускает реально опасное и блокирует безобидное.

Почему фильтры не гарантируют безопасность?

Даже после всех этапов обучения модели сохраняют внутри себя полный объём опасных знаний. По данным MIT Technology Review, компании-разработчики сами сообщают, что некоторые новейшие модели способны проникать в критически важные компьютерные сети на уровне лучших хакеров и создавать дезинформацию не хуже профессиональных манипуляторов.

Обучить модель отказывать, не удаляя из неё опасные навыки, MIT Technology Review сравнивает с установкой пулемёта в каждый автомобиль и попыткой спрятать спусковой крючок под капотом. Целенаправленные злоумышленники уже находят способы обхода. По данным компаний, некоторые пользователи пытаются с помощью продвинутых моделей модифицировать биологические патогены и проектировать автономные рои дронов.

Тема «кибербезопасность и искусственный интеллект урок цифры» приобретает здесь практическое измерение: понимание того, что ИИ-фильтры не являются абсолютной защитой, критически важно для любого, кто работает с этими инструментами или обучает других.

Кто решает, на что модель откажет?

Зико Колтер, член совета директоров OpenAI и сооснователь компании по тестированию ИИ Gray Swan, назвал вопрос о том, где провести границу между допустимым и недопустимым, «огромным». Формулы для этого не существует: вирусологам нужно изучать опасные вирусы, специалистам по безопасности нужно знать уязвимости систем, чтобы закрыть их, а не эксплуатировать.

Сейчас эту границу проводят сами компании, закрыто и без прозрачности. Но правительства тоже получают возможность задавать свои линии. MIT Technology Review прямо указывает: чем лучше ИИ научится отказывать на вредные запросы, тем эффективнее он сможет блокировать идеи, единственный «вред» которых состоит в угрозе тем, кто устанавливает правила. Издание отмечает, что ИИ, возможно, уже отказывается критиковать некоторых авторитарных глав государств.

Пентагон, по данным публикации, вёл переговоры с разработчиками передовых моделей, добиваясь меньшего количества отказов для своих задач.

Что делать с этим прямо сейчас, по ролям?

Авторам Дзена и копирайтерам. Если чат-бот отказал на ваш запрос, это не значит, что вы спросили что-то плохое. Переформулируйте промпт, уточните контекст. Помните: фильтр статистический, а не моральный. Для темы «кибербезопасность и искусственный интеллект урок цифры» это особенно актуально: образовательные запросы о безопасности часто попадают под избыточный отказ.

Маркетологам. Планируя контент-стратегию с ИИ-инструментами, закладывайте ручную проверку. Модель может как пропустить проблемный контент, так и заблокировать нормальный. Ни один фильтр не заменяет редакторского контроля.

Предпринимателям в РФ и СНГ. Границы допустимого задаёт конкретная компания-разработчик по своим, непубличным критериям. Если вы строите продукт на чужой закрытой модели (закрытая модель, модель, код и веса которой недоступны пользователю), вы полностью зависите от чужих решений о том, что модель будет и не будет делать.

Сравнение: как с этим обстоят дела в российских сервисах?

Российские аналоги, YandexGPT и GigaChat, используют собственные фильтры отказов, но работают по тому же принципу: вероятностная фильтрация без публичных критериев. Компании не раскрывают, какие именно категории запросов блокируются и по каким правилам.

Параметр Зарубежные модели (ChatGPT, Claude) Российские модели (YandexGPT, GigaChat)
Принцип фильтрации Вероятностный, без публичных критериев Вероятностный, без публичных критериев
Кто задаёт границы Компания-разработчик плюс регуляторы Компания-разработчик плюс регуляторы РФ
Прозрачность для пользователя Низкая Низкая
Возможность обхода Фиксируется регулярно Не исследовано публично
Мнение редакции dzen.guru

По моим наблюдениям, российские сервисы фильтруют запросы заметно строже в некоторых тематиках, но объяснения отказа пользователь не получает ни там, ни там. Мы в dzen.guru считаем, что главный вывод из этого расследования прост: не доверяйте ИИ-фильтрам как гарантии. Это не замок на двери, а занавеска. Она останавливает случайный взгляд, но не целенаправленного взломщика. Одновременно эта же занавеска может закрыть от вас то, что вы имеете полное право видеть.

Что сделать сегодня: проверьте, не полагаетесь ли вы на ИИ как на единственный барьер безопасности в своих рабочих процессах. Если да, добавьте ручной контроль.

Частые вопросы

Отказ ИИ означает, что мой запрос был опасным?

Нет. Фильтр срабатывает по статистическому сходству с заранее размеченными примерами. Образовательные, медицинские, журналистские запросы регулярно попадают под избыточный отказ. Переформулируйте запрос, добавьте контекст вашей задачи.

Можно ли полностью обойти фильтры ИИ?

По данным MIT Technology Review, целенаправленные попытки обхода уже приводят к успеху. Компании-разработчики сами фиксируют случаи, когда пользователи пытаются использовать продвинутые модели для работы с биологическими патогенами и автономными системами. Фильтры снижают риск, но не устраняют его.

Чем это грозит обычному пользователю в России?

Двумя вещами. Во-первых, модель может отказать вам на безобидный запрос, и вы не узнаете почему. Во-вторых, те же механизмы позволяют властям или компаниям скрытно ограничивать доступ к информации, и вы тоже об этом не узнаете. Понимание этих рисков и есть практический урок на стыке кибербезопасности и искусственного интеллекта.

Отказ ИИ выполнять запрос, это не моральное суждение машины, а корпоративное решение, спрятанное за интерфейсом. Пока критерии закрыты, а механизмы ненадёжны, единственная настоящая защита остаётся за человеком, который понимает, как это работает, и не передоверяет машине ни безопасность, ни право решать, что ему можно знать.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Авито делит GPU в Kubernetes как Meta: опыт после KubeCon Japan 2026
ai

Авито делит GPU в Kubernetes как Meta: опыт после KubeCon Japan 2026

Компания Авито второго июня поделилась опытом внедрения инструментов распределения GPU в Kubernetes для нейросетей после конференции KubeCon Japan 2026, где…

6 мин
FPGA для нейросетей за $50: инженер запустил LLM без GPU на плате с AliExpress
ai

FPGA для нейросетей за $50: инженер запустил LLM без GPU на плате с AliExpress

Почему это важно Русскоязычный инженер собрал работающий ИИ-ускоритель на FPGA за 50 долларов и запустил на нём языковую модель без видеокарты NVIDIA, доказав,…

5 мин
Авито раскрыла архитектуру кластера для обучения нейросети: GPU, InfiniBand, Kubernetes
ai

Авито раскрыла архитектуру кластера для обучения нейросети: GPU, InfiniBand, Kubernetes

Распределённое обучение больших языковых моделей (LLM, large language model) на собственных GPU остаётся задачей, которую большинство команд в России решают…

6 мин