Игорь Градов
Игорь Градов
6 мин
ai

ИИ-безопасность против исследователей: модели блокируют легальный поиск уязвимостей

Российские киберзащитники и исследователи уязвимостей всё чаще сталкиваются с парадоксом: нейросети, которые должны помогать находить бреши в коде, отказываются работать с любыми запросами, похожими на атаку, и мешают легальной защите не меньше, чем нелегальной.

ИИ-безопасность против исследователей: модели блокируют легальный поиск уязвимостей
Почему это важно

Защитные ограничения крупнейших ИИ-моделей не отличают хакера от специалиста по ИИ-безопасности: обе стороны получают отказ на одни и те же запросы, и легальные исследователи теряют рабочий инструмент.

Проблема не нова, но в июне 2025 года она обострилась. Правительство США ввело экспортные ограничения на модели Anthropic «Mythos» и «Fable» после отчёта о возможности обхода их защитных барьеров. По данным TechCrunch, ограничения на «Fable 5» и «Mythos 5» позже сняли: «Fable 5» вернулась в открытый доступ 1 июля, а «Mythos 5» доступна только проверенным американским организациям. Сам факт блокировки показал, насколько хрупок баланс между ИИ-безопасностью и полезностью моделей для профессионалов.

И Anthropic, и OpenAI предлагают специальные программы доступа для киберисследователей: Trusted Access for Cyber у OpenAI и Cyber Verification Program у Anthropic. Но даже участники этих программ жалуются на непоследовательность ограничений.

Что понадобится

  • Закрытая модель (закрытая модель, код которой недоступен пользователю) с программой доступа для исследователей: Claude (Anthropic) через Cyber Verification Program или ChatGPT/GPT-4 (OpenAI) через Trusted Access for Cyber. Подать заявку можно на сайтах компаний.
  • Открытая модель без ограничений для локального запуска: Llama (Meta), Mistral или аналоги. Нужен компьютер с видеокартой от 16 ГБ видеопамяти или облачный сервер.
  • Среда для локального инференса (инференс, запуск модели для получения ответа, а не для обучения): Ollama, llama.cpp или vLLM.
  • Базовое понимание промпт-инжиниринга (промпт-инжиниринг, умение формулировать запросы к нейросети так, чтобы получить нужный результат).
  • Время: от 30 минут на настройку локальной модели до нескольких дней на ожидание одобрения в программах доступа.

Пошаговая инструкция

  1. Определите, какой этап работы блокирует модель. Разделите задачи на те, где ограничения мешают (поиск уязвимостей, генерация эксплойтов), и те, где закрытая модель работает без проблем (анализ кода, реверс-инжиниринг, написание вспомогательных скриптов). Крис Энли, главный учёный консалтинговой компании NCC Group, объяснил TechCrunch: попросить модель проэксплуатировать баг, это ключевой шаг для подтверждения реальной уязвимости, но именно на нём срабатывает блокировка.

  2. Для «безопасных» задач используйте закрытую модель напрямую. Джузеппе Кали, исследователь уязвимостей нулевого дня (zero-day, ранее неизвестная уязвимость в ПО), рассказал TechCrunch, что применяет ИИ только для начального реверс-инжиниринга и создания вспомогательных инструментов, а поиск самих уязвимостей оставляет себе. Такой подход не упирается в ограничения.

  3. Для «чувствительных» задач разверните открытую модель локально. Это главный обходной путь, который описали несколько исследователей в материале TechCrunch. Паоло Стагно, технический директор компании Crowdfense (занимается покупкой и продажей уязвимостей госструктурам), объяснил, почему: отправка данных об уязвимостях в облачную модель рискует утечкой или попаданием информации в обучающие данные (training data, массив текстов и кода, на котором модель училась). Локальная открытая модель не передаёт данные наружу.

  4. Установите модель через Ollama или llama.cpp. Пример для Ollama:

# Установка Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Загрузка модели (например, Mistral или CodeLlama)
ollama pull mistral

# Запуск диалога
ollama run mistral
  1. Формулируйте промпт без «атакующих» слов, если работаете с закрытой моделью. Крис Энли подчеркнул парадокс: промпт «исправь этот код» одновременно помогает защитнику и показывает путь к уязвимости. Модель не может разделить эти два намерения. Попробуйте описать задачу как задачу защиты:
Проанализируй следующий фрагмент кода на наличие
ошибок управления памятью. Укажи строки, где
возможно переполнение буфера, и предложи
безопасную замену.
  1. Подайте заявку в программу доступа, если ваша работа требует регулярного использования закрытых моделей. OpenAI и Anthropic рассматривают заявки от организаций. Учтите: по словам Криса Томпсона, главы компании RemoteThreat и основателя конференции Offensive AI Con, даже внутри программ доступа ограничения работают непоследовательно и меняются день ото дня.
Как это выглядит на практике

Исследователь из компании-производителя компонентов для смартфонов (имя не раскрыто, TechCrunch предоставил анонимность) рассказал: его работодатель не входит в программу Cyber Verification Program от Anthropic, и в результате инструменты компании «почти бесполезны для поиска уязвимостей, потому что ограничения слишком строгие». По его словам, «если модель чувствует, что мы делаем что-то связанное с безопасностью, она просто останавливается и становится непригодной». Переход на локальную открытую модель без ограничений позволил команде продолжить работу без утечки данных в облако.

Частые ошибки
  • Отправлять данные о реальных уязвимостях в облачные модели. Паоло Стагно прямо предупредил: информация может попасть в обучающие данные будущих версий модели. Используйте облачные модели только для общих задач.
  • Тратить часы на «переговоры» с моделью. Крис Томпсон описал типичную ситуацию: вместо работы над задачей исследователь тратит время, уговаривая модель ответить. Если модель отказала дважды, переключайтесь на локальную.
  • Считать, что открытая модель решит всё. Открытые модели (опенсорс) уступают закрытым по качеству рассуждений на сложных задачах. Используйте их для конкретных шагов, где нужна свобода запросов, а закрытые там, где нужна глубина анализа.
  • Игнорировать правовой контекст. В России работа с уязвимостями регулируется законодательством. Локальный запуск модели снимает проблему утечки данных, но не снимает юридической ответственности за действия с чужими системами без разрешения.

Что делать с этим прямо сейчас?

Автору Дзена и контент-специалисту. Если вы пишете о кибербезопасности, вы столкнётесь с тем, что ChatGPT и Claude откажутся генерировать даже учебные примеры атак для статьи. Формулируйте промпт как задачу защиты, не атаки. Это работает и для образовательного контента.

Маркетологу. ИИ-безопасность становится продающим аргументом: компании, которые предлагают ИИ-инструменты без облачной передачи данных, получают преимущество на рынке B2B. Если ваш продукт работает локально, это стоит выделять в позиционировании.

Специалисту по безопасности в РФ и СНГ. Программы доступа OpenAI и Anthropic ориентированы на американские организации. Российским исследователям они фактически недоступны. Основной рабочий путь: открытые модели (Llama, Mistral, DeepSeek) с локальным запуском. Из российских инструментов можно пробовать YandexGPT и GigaChat для задач анализа кода, но для работы с уязвимостями они также могут блокировать запросы.

Мнение редакции dzen.guru

Ситуация с ограничениями в ИИ-безопасности напоминает историю с антивирусами: инструмент защиты и инструмент атаки неразделимы. Марк Дауд, исследователь с многолетним стажем, точно сформулировал проблему для TechCrunch: «Мне некомфортно, что случайные крупные компании принимают произвольные решения о том, что безопасно в сфере безопасности, а что нет». Крис Энли сравнил ИИ с молотком: без него не построишь дом, но он же может быть оружием, и эти два свойства нельзя разделить. По моим наблюдениям, для специалистов из России единственный надёжный путь сейчас: локальные открытые модели плюс закрытые модели для некритичных этапов. Идеального решения пока нет, и честно это признать полезнее, чем обещать обходные пути.

Джузеппе Кали, который находит и разрабатывает эксплойты для уязвимостей нулевого дня, закрыл тему фразой, которую стоит запомнить: «Я ревниво отношусь к своим багам и слишком люблю эту игру, чтобы позволить моделям играть за меня». Пока ИИ не научился отличать защитника от атакующего, последнее слово остаётся за человеком с локальной моделью и здравым смыслом.

Научитесь формулировать промпты, которые работают

Бесплатный мини-курс по промпт-инжинирингу от dzen.guru поможет получать от нейросетей результат с первого запроса, без «переговоров» и отказов.

Попробовать бесплатно
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Демон Лапласа стал Python-проектом: код показывает, почему ИИ не может предсказать всё
ai

Демон Лапласа стал Python-проектом: код показывает, почему ИИ не может предсказать всё

Демон Лапласа в 1814 году описал мысленный эксперимент, который два века спустя можно проверить руками: открытый Python-проект формализует идею «всезнающего…

6 мин
Bad CaRMa: нейросеть «квартет» показала на 31 млрд записей, почему не повторит крах Vision
ai

Bad CaRMa: нейросеть «квартет» показала на 31 млрд записей, почему не повторит крах Vision

Компания-разработчик обобщённой модели данных «квартет» 10 июня опубликовала технический разбор под названием Bad CaRMa, в котором показала, почему их…

6 мин
ИИ-боты обрушили thenumbers.com: 90% трафика оказалось нечеловеческим
ai

ИИ-боты обрушили thenumbers.com: 90% трафика оказалось нечеловеческим

Теперь дам тело новости строго по фактам из оригинала, с учётом всех требований системного промпта. Российские аналитики кино, журналисты и продюсеры, которые…

6 мин