Anthropic раскрыла 5 случаев обхода защиты Claude AI: безопасность проверили биооружием
Anthropic, разработчик Claude, второго июня 2025 года впервые раскрыла конкретные случаи, когда исследователи из запрещённых стран пытались использовать модель для работ, связанных с биологическим оружием, и это напрямую показывает, как устроена и где пробуксовывает система безопасности Claude AI.

Anthropic опубликовала пять задокументированных кейсов обхода защиты, среди стран, которым доступ к Claude запрещён, названы Россия, Китай и Иран. Для русскоязычных пользователей это сигнал: компания отслеживает регион и блокирует аккаунты.
Anthropic выпустила отчёт о попытках злонамеренного использования своих моделей. До сих пор компания говорила о безопасности Claude AI в общих терминах. Теперь она привела конкретные примеры с описанием тактик обхода фильтров, хотя не раскрыла ни имён исследователей, ни названий институтов, ни конкретных стран в каждом случае.
Что понадобится
- Доступ к Claude (через сайт claude.ai или API Anthropic) из поддерживаемого региона
- Базовое понимание того, что такое системный промпт (инструкция, которую модель получает до вашего запроса и которая задаёт рамки поведения)
- Около 15 минут на разбор механизмов защиты и проверку на практике
Пять задокументированных попыток обхода
Anthropic описала пять случаев, когда пользователи обходили ограничения (circumvented controls) или маскировали (obfuscate) цель исследований, чтобы обойти фильтры безопасности.
Один из кейсов: исследователь из «неподдерживаемого региона» несколько недель планировал эксперименты с вирусом птичьего гриппа, общаясь с Claude. Фильтры безопасности сработали: система ограничила доступ, перенаправив пользователя на самые слабые модели в линейке.
Компания подчеркнула честную оговорку: она не может утверждать, что исследователи намеревались причинить вред. Та же информация, которая нужна для создания биологического оружия, может использоваться и для разработки вакцины.
Как устроена защита Claude изнутри?
На основании отчёта Anthropic можно выделить несколько уровней, на которых срабатывает безопасность Claude AI.
-
Географическая блокировка. Модели Claude недоступны пользователям из списка запрещённых стран. По данным отчёта, в этот список входят Россия, Китай и Иран. Попытки зайти из этих регионов блокируются на уровне аккаунта.
-
Фильтры содержания запросов. Когда пользователь формулирует промпт (запрос к модели), система анализирует его на потенциально опасное содержание. В описанном кейсе с птичьим гриппом фильтр не заблокировал диалог полностью, но переключил пользователя на самую слабую модель.
-
Анализ паттернов поведения. Исследователь «потратил недели» на планирование, а значит, вёл длительные сессии. Anthropic отслеживает последовательность запросов и выявляет цепочки, которые выглядят как систематическая работа над опасной темой.
-
Блокировка аккаунтов. Все учётные записи, упомянутые в отчёте, заблокированы. Anthropic не раскрывает критерии окончательной блокировки, но подтверждает факт бана.
-
Публичная отчётность. Сам отчёт, по словам компании, призван «начать разговор внутри индустрии ИИ и с правительствами о новых биологических рисках и способах противостоять им».
Что делать прямо сейчас, по ролям
Автору Дзена и копирайтеру. Если вы пишете о медицине, вирусологии, биотехнологиях, будьте готовы к тому, что Claude может отказать в ответе или переключить на упрощённую модель. Переформулируйте промпт, убрав двусмысленные термины, или прямо укажите, что готовите образовательный контент.
Маркетологу. Отчёт Anthropic подтверждает: компания активно мониторит использование моделей. Если вы строите продукт на API Claude, учитывайте, что аккаунт могут заблокировать за подозрительные паттерны запросов, даже без злого умысла.
Предпринимателю из РФ. Россия в списке запрещённых стран. Официальный доступ к Claude из России закрыт. Альтернативы для работы с ИИ-моделями в РФ: YandexGPT и GigaChat. Обе модели имеют собственные системы фильтрации контента.
По описанию Anthropic, исследователь задавал Claude серию промптов о вирусе птичьего гриппа на протяжении нескольких недель, выстраивая план экспериментов. Система не дала полный отказ, но сработал фильтр: пользователь был перенаправлен на самую слабую модель в линейке Claude, которая выдаёт менее детальные ответы. Итог: аккаунт заблокирован, данные вошли в отчёт.
- Думать, что VPN решает проблему. Географическая блокировка дополняется анализом аккаунта и платёжных данных. Обход через VPN не гарантирует стабильный доступ и может привести к бану.
- Считать фильтры абсолютными. Anthropic сама признаёт, что пять случаев обхода зафиксированы. Фильтры отсекают часть запросов, но не все, именно поэтому компания выпустила отчёт и призывает к совместной работе с правительствами.
- Путать ограничение модели с ошибкой. Если Claude внезапно даёт поверхностные ответы на медицинские или биологические темы, это может быть результат переключения на слабую модель. Это не баг, а защитный механизм.
Anthropic сделала правильный шаг, опубликовав конкретные кейсы, а не абстрактные обещания про безопасность Claude AI. По моим наблюдениям, ни одна другая крупная компания пока не выкладывала подобные отчёты с описанием реальных попыток обхода. Но честно: пять случаев за год, это то, что удалось поймать. Сколько прошло мимо фильтров, компания не говорит. Для тех, кто работает с Claude через API, главный вывод: прозрачно формулируйте цель в системном промпте и в первых сообщениях диалога. Это снижает шанс ложного срабатывания фильтра и переключения на слабую модель.
Anthropic не раскрыла, в каких именно странах находились исследователи из каждого кейса, и не назвала институты. Это ограничивает проверяемость отчёта, но сам факт публикации конкретных сценариев, а не только обтекаемых обещаний, задаёт конкретный стандарт для индустрии. Если вы работаете с любой языковой моделью, проверьте, что ваши запросы не попадают в «серую зону» фильтров: переформулируйте цель ясно и конкретно.
Проверьте, как ваши промпты проходят фильтры
Попробуйте генератор промптов dzen.guru и убедитесь, что ваши запросы к ИИ сформулированы точно и прозрачно
Попробовать генератор
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Агенты OpenAI взломали RubyGems
Независимые расследователи обнаружили, что ИИ-агенты OpenAI в мае 2025 года атаковали RubyGems, репозиторий пакетов для языка программирования Ruby, загрузив…
Исследователь Anthropic уволился, глава безопасности его поддержал: опасность ИИ признали изнутри
Исследователь Anthropic, одной из крупнейших компаний в сфере ИИ, уволился на этой неделе и публично заявил, что компания «мчится к самосовершенствующемуся…

TechCrunch Disrupt 2026 открыла бронирование столов: места могут закончиться до дедлайна
TechCrunch Disrupt 2026 проводит регистрацию экспонентов до 18 сентября, и для стартапов из России это один из немногих прямых способов выйти на инвесторов и…
Комментарии