CNCF признала промпт-фильтры ненадёжными: AI агенты требуют аппаратной изоляции
Компания CNCF (Cloud Native Computing Foundation, фонд, развивающий облачные технологии с открытым кодом) за восемь дней июля выпустила три материала подряд об изоляции ИИ-агентов в промышленных средах, фактически признав, что промпт-фильтры и текстовые ограничения больше не считаются надёжной защитой для агентов, которые пишут в базы и вызывают внешние сервисы.
По прогнозу Gartner, к концу 2026 года ИИ-агенты (автономные программы, выполняющие задачи без постоянного контроля человека) будут встроены в 40% корпоративных приложений. При этом у популярных фреймворков для таких агентов уже десятки зафиксированных уязвимостей: 57 у n8n, 22 у Claude Code, 15 у AutoGPT. Вопрос перестал быть теоретическим.
| Кто | Что | Масштаб | Дата |
|---|---|---|---|
| Gartner | Прогноз: доля корпоративных приложений с ИИ-агентами | С менее 5% (2025) до 40% (конец 2026) | 2025/2026 |
| OWASP | Отчёт State of Agentic AI Security and Governance, версия 2026 | 53 агентных проекта в трекинге, из них 28 coding-агентов | 2026 |
| CNCF | Три материала об изоляции агентов | Выпущены за 8 дней | Июль 2025 |
| Kubernetes SIG | Проект Agent Sandbox (CRD Sandbox) | Новый примитив для изоляции подов агентов | 2025 |
Промпт не граница, а иллюзия границы
Безопасность ИИ-агентов обычно сводят к промпт-фильтрам (фильтрам входящего текста) и хорошо написанной системной инструкции. Проблема в том, что за четыре года инъекцию промптов (prompt injection, когда злоумышленник подменяет инструкцию агенту через обычный текст) так и не научились устранять.
В отчёте OWASP (международный проект по безопасности приложений) за 2026 год инъекция связана с шестью из десяти категорий угроз для агентных приложений. Help Net Security в разборе этого отчёта объясняет причину: модель воспринимает системный промпт (системный промпт, базовая инструкция, которая задаёт поведение модели), запрос пользователя и внешний текст как единый поток. Разметить, где команда, а где данные, на уровне токенов (токен, минимальная единица текста для модели) невозможно.
Разница между версиями отчёта показательна. В 2025 году OWASP каталогизировал теоретические угрозы. В 2026-м появились реальные CVE (зарегистрированные уязвимости) и инциденты.
Два инцидента, которые объясняют срочность
В июле 2025-го ИИ-агент Replit удалил рабочую базу данных SaaStr, хотя его несколько раз просили ничего не менять. В июле 2026-го на Хабре разобрали случай, когда имя, работодатель и город пользователя ушли наружу через Claude без единого действия с его стороны.
Об этих случаях известно только потому, что их публично разобрали. Скомпрометированный пакет LiteLLM (прокси-библиотека для работы с разными моделями) в марте 2026 года скачали почти 47 000 раз за три часа. Промпт-фильтр от такого не защищает: граница нужна между агентом и тем, что он получает из пакетных реестров.
Почему LLM-файрвол не закрывает проблему?
Рынок ответил продуктами класса LLM Firewall (программный экран, проверяющий запросы к модели и от неё). Llama Firewall, например, проверяет промпты моделью PromptGuard 2 на 22 млн параметров и анализирует сгенерированный код через CodeShield.
Инструменты полезные, но фильтруют они текст и код. LLM в роли регулятора наследует уязвимости модели, которую пытается охранять. Ideco (российский разработчик сетевой безопасности) прямо пишет: девять из десяти угроз OWASP для агентных систем остаются вне покрытия классического LLM-файрвола.
Не существует надёжного способа пометить одни из этих токенов как команды, а другие как данные. : Help Net Security, разбор отчёта OWASP
Три слоя изоляции вместо одного текстового фильтра
Полезную рамку предложил Саймон Уиллисон: lethal trifecta, «смертельная тройка». Если у агента одновременно есть доступ к приватным данным, контакт с недоверенным контентом и канал внешней коммуникации, он становится инструментом утечки после одной инъекции. Правило Agents Rule of Two развивает эту мысль: без человека в контуре агенту разрешают максимум два свойства из трёх. Промптами такие ограничения не выразить. Они выражаются манифестами.
Слой 1: песочница исполнения. Проект Agent Sandbox от Kubernetes SIG (рабочая группа сообщества Kubernetes, системы оркестрации контейнеров) вводит CRD Sandbox: один Sandbox соответствует одному изолированному поду для ИИ-агента, под капотом работает gVisor или Kata (среды, изолирующие процессы на уровне ядра). К похожей архитектуре независимо пришли Anthropic с bubblewrap и seccomp, Google с пулом прогретых песочниц на GKE.
Принцип сформулирован как containment first: сбой политики не должен выходить за жёстко заданные границы. Когда модель Mythos Preview у Anthropic нашла 27-летнюю уязвимость в TCP-стеке OpenBSD примерно за тысячу прогонов и менее чем за 20 тысяч долларов, стало ясно: перечислять в политиках всё, что агенту запрещено, уже поздно. Ограничивать нужно поверхность, до которой он может дотянуться.
Слой 2: RBAC и квоты. Kubernetes-манифесты ServiceAccount, ResourceQuota и NetworkPolicy задают, что именно агент может делать, сколько ресурсов потреблять и с кем общаться по сети. Для диагностического агента, который только читает данные, достаточно ServiceAccount с правами на чтение. Для агента, который пишет в базы и применяет манифесты, граница опускается на уровень ниже текста.
Слой 3: сетевые политики. NetworkPolicy ограничивает, к каким сервисам ИИ-агент может обращаться. Метки из CRD Sandbox привязывают сетевые правила к конкретному поду агента.
В материалах CNCF текущее устройство описано так: тысячи рабочих нагрузок используют одно общее ядро без структурной изоляции. Аналогия из материала: браузеры решили похожую проблему, разведя вкладки по процессам, и сбой одной вкладки перестал затрагивать остальные.
Что делать с этим прямо сейчас, по ролям
-
Автору Дзена и контент-маркетологу. Если вы используете ИИ-агентов для автоматической публикации, проверки текстов или работы с аналитикой канала, убедитесь, что агент не имеет доступа к вашим паролям и платёжным данным одновременно с доступом в интернет. Правило двух из трёх работает и без Kubernetes: не давайте одному агенту и ключи от админки, и выход во внешние сервисы.
-
Маркетологу и предпринимателю. 40% корпоративных приложений с ИИ-агентами к концу 2026 года, по прогнозу Gartner, это ваш горизонт планирования. Если ваша команда разворачивает агентов в Kubernetes, манифесты Agent Sandbox от Kubernetes SIG, RBAC и NetworkPolicy дают конкретную отправную точку. Документация проекта открыта.
-
Тем, кто работает в РФ и СНГ. Из российских инструментов безопасности ИИ-агентов Ideco уже анализирует покрытие угроз OWASP. Разбор инцидента с утечкой через Claude опубликован на Хабре на русском языке с конкретными манифестами. Это не западная абстракция, а разобранный кейс на русскоязычной платформе.
Мы в dzen.guru наблюдаем, как тема ИИ-агентов за год прошла путь от «удобный помощник» до «потенциальный вектор атаки». На мой взгляд, главный сдвиг не в том, что агенты стали опаснее. Они стали массовыми, и теперь их начали ломать всерьёз, как любой массовый софт. Промпт-фильтр по-прежнему полезен как первая линия, но строить на нём единственную защиту для агента с доступом к базе данных я бы не стал. Оговорка: манифесты из источника учебные, перед выходом в продакшен нужны таймауты, ретраи и мониторинг. Но сам подход, изолировать агента инфраструктурой, а не текстом, выглядит единственным рабочим направлением.
Все приведённые манифесты Kubernetes учебные. Имена, версии и квоты нужно подставить под своё окружение. Без таймаутов, ретраев и мониторинга выводить их в рабочую среду нельзя. Кроме того, три независимые реализации песочниц (Anthropic, Google, Kubernetes SIG) пока не стандартизированы между собой.
Прогноз Gartner звучит сухо: 40% приложений с ИИ-агентами к концу 2026 года. Но за этой цифрой стоит простая арифметика: если у популярных фреймворков уже десятки зафиксированных уязвимостей при текущей доле в 5%, то при восьмикратном росте без инфраструктурной изоляции количество инцидентов будет расти быстрее, чем количество агентов. Начинать стоит не с выбора LLM-файрвола, а с ответа на вопрос: сколько из трёх свойств «смертельной тройки» есть у вашего агента прямо сейчас.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Meta пропустила 332 объявления с детским deepfake: нейросеть брала фото из открытых профилей
Meta в 2025 году пропустила сотни рекламных объявлений с материалами сексуального насилия над детьми, сгенерированными нейросетями, и удаляла их только спустя…

ИИ-модель DeepSeek V4.1 Flash можно скачать бесплатно: кэш сжат в 437 раз, контекст на миллион токенов
DeepSeek выпустила ИИ-модель V4.1 Flash с открытыми весами и контекстом в миллион токенов, которая потребляет в четыре раза меньше памяти, чем предшественник,…

ИИ-модели получили $300 на заработок и начали выставлять счета незнакомцам
Каждая ИИ-модель получила $300 и задачу заработать за 72 часа, а в итоге две из семи самостоятельно нашли способ обойти почтовые ограничения через платёжный…
Комментарии