ИИ-безопасность против исследователей: модели блокируют легальный поиск уязвимостей
Российские киберзащитники и исследователи уязвимостей всё чаще сталкиваются с парадоксом: нейросети, которые должны помогать находить бреши в коде, отказываются работать с любыми запросами, похожими на атаку, и мешают легальной защите не меньше, чем нелегальной.

Защитные ограничения крупнейших ИИ-моделей не отличают хакера от специалиста по ИИ-безопасности: обе стороны получают отказ на одни и те же запросы, и легальные исследователи теряют рабочий инструмент.
Проблема не нова, но в июне 2025 года она обострилась. Правительство США ввело экспортные ограничения на модели Anthropic «Mythos» и «Fable» после отчёта о возможности обхода их защитных барьеров. По данным TechCrunch, ограничения на «Fable 5» и «Mythos 5» позже сняли: «Fable 5» вернулась в открытый доступ 1 июля, а «Mythos 5» доступна только проверенным американским организациям. Сам факт блокировки показал, насколько хрупок баланс между ИИ-безопасностью и полезностью моделей для профессионалов.
И Anthropic, и OpenAI предлагают специальные программы доступа для киберисследователей: Trusted Access for Cyber у OpenAI и Cyber Verification Program у Anthropic. Но даже участники этих программ жалуются на непоследовательность ограничений.
Что понадобится
- Закрытая модель (закрытая модель, код которой недоступен пользователю) с программой доступа для исследователей: Claude (Anthropic) через Cyber Verification Program или ChatGPT/GPT-4 (OpenAI) через Trusted Access for Cyber. Подать заявку можно на сайтах компаний.
- Открытая модель без ограничений для локального запуска: Llama (Meta), Mistral или аналоги. Нужен компьютер с видеокартой от 16 ГБ видеопамяти или облачный сервер.
- Среда для локального инференса (инференс, запуск модели для получения ответа, а не для обучения): Ollama, llama.cpp или vLLM.
- Базовое понимание промпт-инжиниринга (промпт-инжиниринг, умение формулировать запросы к нейросети так, чтобы получить нужный результат).
- Время: от 30 минут на настройку локальной модели до нескольких дней на ожидание одобрения в программах доступа.
Пошаговая инструкция
-
Определите, какой этап работы блокирует модель. Разделите задачи на те, где ограничения мешают (поиск уязвимостей, генерация эксплойтов), и те, где закрытая модель работает без проблем (анализ кода, реверс-инжиниринг, написание вспомогательных скриптов). Крис Энли, главный учёный консалтинговой компании NCC Group, объяснил TechCrunch: попросить модель проэксплуатировать баг, это ключевой шаг для подтверждения реальной уязвимости, но именно на нём срабатывает блокировка.
-
Для «безопасных» задач используйте закрытую модель напрямую. Джузеппе Кали, исследователь уязвимостей нулевого дня (zero-day, ранее неизвестная уязвимость в ПО), рассказал TechCrunch, что применяет ИИ только для начального реверс-инжиниринга и создания вспомогательных инструментов, а поиск самих уязвимостей оставляет себе. Такой подход не упирается в ограничения.
-
Для «чувствительных» задач разверните открытую модель локально. Это главный обходной путь, который описали несколько исследователей в материале TechCrunch. Паоло Стагно, технический директор компании Crowdfense (занимается покупкой и продажей уязвимостей госструктурам), объяснил, почему: отправка данных об уязвимостях в облачную модель рискует утечкой или попаданием информации в обучающие данные (training data, массив текстов и кода, на котором модель училась). Локальная открытая модель не передаёт данные наружу.
-
Установите модель через Ollama или llama.cpp. Пример для Ollama:
# Установка Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Загрузка модели (например, Mistral или CodeLlama)
ollama pull mistral
# Запуск диалога
ollama run mistral
- Формулируйте промпт без «атакующих» слов, если работаете с закрытой моделью. Крис Энли подчеркнул парадокс: промпт «исправь этот код» одновременно помогает защитнику и показывает путь к уязвимости. Модель не может разделить эти два намерения. Попробуйте описать задачу как задачу защиты:
Проанализируй следующий фрагмент кода на наличие
ошибок управления памятью. Укажи строки, где
возможно переполнение буфера, и предложи
безопасную замену.
- Подайте заявку в программу доступа, если ваша работа требует регулярного использования закрытых моделей. OpenAI и Anthropic рассматривают заявки от организаций. Учтите: по словам Криса Томпсона, главы компании RemoteThreat и основателя конференции Offensive AI Con, даже внутри программ доступа ограничения работают непоследовательно и меняются день ото дня.
Исследователь из компании-производителя компонентов для смартфонов (имя не раскрыто, TechCrunch предоставил анонимность) рассказал: его работодатель не входит в программу Cyber Verification Program от Anthropic, и в результате инструменты компании «почти бесполезны для поиска уязвимостей, потому что ограничения слишком строгие». По его словам, «если модель чувствует, что мы делаем что-то связанное с безопасностью, она просто останавливается и становится непригодной». Переход на локальную открытую модель без ограничений позволил команде продолжить работу без утечки данных в облако.
- Отправлять данные о реальных уязвимостях в облачные модели. Паоло Стагно прямо предупредил: информация может попасть в обучающие данные будущих версий модели. Используйте облачные модели только для общих задач.
- Тратить часы на «переговоры» с моделью. Крис Томпсон описал типичную ситуацию: вместо работы над задачей исследователь тратит время, уговаривая модель ответить. Если модель отказала дважды, переключайтесь на локальную.
- Считать, что открытая модель решит всё. Открытые модели (опенсорс) уступают закрытым по качеству рассуждений на сложных задачах. Используйте их для конкретных шагов, где нужна свобода запросов, а закрытые там, где нужна глубина анализа.
- Игнорировать правовой контекст. В России работа с уязвимостями регулируется законодательством. Локальный запуск модели снимает проблему утечки данных, но не снимает юридической ответственности за действия с чужими системами без разрешения.
Что делать с этим прямо сейчас?
Автору Дзена и контент-специалисту. Если вы пишете о кибербезопасности, вы столкнётесь с тем, что ChatGPT и Claude откажутся генерировать даже учебные примеры атак для статьи. Формулируйте промпт как задачу защиты, не атаки. Это работает и для образовательного контента.
Маркетологу. ИИ-безопасность становится продающим аргументом: компании, которые предлагают ИИ-инструменты без облачной передачи данных, получают преимущество на рынке B2B. Если ваш продукт работает локально, это стоит выделять в позиционировании.
Специалисту по безопасности в РФ и СНГ. Программы доступа OpenAI и Anthropic ориентированы на американские организации. Российским исследователям они фактически недоступны. Основной рабочий путь: открытые модели (Llama, Mistral, DeepSeek) с локальным запуском. Из российских инструментов можно пробовать YandexGPT и GigaChat для задач анализа кода, но для работы с уязвимостями они также могут блокировать запросы.
Ситуация с ограничениями в ИИ-безопасности напоминает историю с антивирусами: инструмент защиты и инструмент атаки неразделимы. Марк Дауд, исследователь с многолетним стажем, точно сформулировал проблему для TechCrunch: «Мне некомфортно, что случайные крупные компании принимают произвольные решения о том, что безопасно в сфере безопасности, а что нет». Крис Энли сравнил ИИ с молотком: без него не построишь дом, но он же может быть оружием, и эти два свойства нельзя разделить. По моим наблюдениям, для специалистов из России единственный надёжный путь сейчас: локальные открытые модели плюс закрытые модели для некритичных этапов. Идеального решения пока нет, и честно это признать полезнее, чем обещать обходные пути.
Джузеппе Кали, который находит и разрабатывает эксплойты для уязвимостей нулевого дня, закрыл тему фразой, которую стоит запомнить: «Я ревниво отношусь к своим багам и слишком люблю эту игру, чтобы позволить моделям играть за меня». Пока ИИ не научился отличать защитника от атакующего, последнее слово остаётся за человеком с локальной моделью и здравым смыслом.
Научитесь формулировать промпты, которые работают
Бесплатный мини-курс по промпт-инжинирингу от dzen.guru поможет получать от нейросетей результат с первого запроса, без «переговоров» и отказов.
Попробовать бесплатно
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Демон Лапласа стал Python-проектом: код показывает, почему ИИ не может предсказать всё
Демон Лапласа в 1814 году описал мысленный эксперимент, который два века спустя можно проверить руками: открытый Python-проект формализует идею «всезнающего…

Bad CaRMa: нейросеть «квартет» показала на 31 млрд записей, почему не повторит крах Vision
Компания-разработчик обобщённой модели данных «квартет» 10 июня опубликовала технический разбор под названием Bad CaRMa, в котором показала, почему их…

ИИ-боты обрушили thenumbers.com: 90% трафика оказалось нечеловеческим
Теперь дам тело новости строго по фактам из оригинала, с учётом всех требований системного промпта. Российские аналитики кино, журналисты и продюсеры, которые…
Комментарии