Игорь Градов
Игорь Градов
7 мин
ai

Фильм, где искусственный интеллект вышел из-под контроля, стал реальностью: как защитить бизнес от ИИ-агентов

Компания INFERA описала подход к защите корпоративной инфраструктуры от рисков, связанных не с самими языковыми моделями, а с действиями ИИ-агентов, которые эти модели запускают в рабочей среде.

Фильм, где искусственный интеллект вышел из-под контроля, стал реальностью: как защитить бизнес от ИИ-агентов
Почему это важно

Классические системы защиты (LLM Firewall) контролируют запросы к моделям и ответы, но не видят, что агент делает дальше: какие файлы открывает, к каким базам обращается, какие API вызывает. Именно на этом уровне происходят реальные инциденты.

Сюжет, знакомый по любому фильму, где искусственный интеллект вышел из под контроля, перестал быть фантастикой для ИТ-отделов. Разница в том, что в кино ИИ захватывает ракетные шахты, а в реальности корпоративный ИИ-агент (программа, которая сама выбирает инструменты и выполняет задачи без постоянного участия человека) тихо отправляет клиентскую базу через легитимный вызов рабочего инструмента. И ни один фильм, где искусственный интеллект вышел из под контроля, не предупреждал, что угроза придёт не от «злого разума», а от банального отсутствия инвентаризации.

По данным INFERA, большинство компаний, заявляющих «у нас ИИ нет, мы только планируем внедрение», уже имеют десятки точек использования публичных моделей, IDE-ассистентов (помощников внутри среды разработки), локальных агентов и low-code-платформ (конструкторов приложений без написания кода). При этом ни инвентаризации, ни политик, ни видимости происходящего у таких компаний, как правило, нет.

Почему LLM Firewall закрывает только половину проблемы?

LLM Firewall (система фильтрации запросов и ответов к языковой модели) решает конкретную задачу: не дать утечь данным через промпт (запрос к модели) и не пропустить вредоносный контент в ответе. Но агент после получения ответа от модели переходит к действиям.

Вот что, по описанию INFERA, Firewall почти не видит:

  • Вызов разрешённого инструмента с подменёнными аргументами
  • Отравление инструмента (tool poisoning), когда сам инструмент работает не так, как задумано
  • Вывод данных через легитимный вызов рабочего инструмента (tool call)
  • Отклонение агента от исходного намерения пользователя
  • Использование избыточных привилегий, которые агенту выдали при настройке

Образно: LLM Firewall защищает «мозг» агента, но оставляет его «руки» без присмотра. А ущерб наносят именно руки.

Что такое Shadow AI и почему он глубже, чем кажется?

Shadow AI (теневой ИИ) в привычном понимании это когда сотрудник использует ChatGPT или Claude без ведома ИТ-отдела. Но INFERA описывает более глубокий слой проблемы.

Настоящий теневой ИИ живёт в MCP-инструментах (Model Context Protocol, протокол, через который агент подключается к внешним сервисам), в локальных агентах на рабочих станциях, внутри IDE разработчиков и в корпоративных приложениях. Обычный Firewall видит только API-трафик к «теневым» моделям и почти не видит то, что происходит локально.

Именно поэтому контроль теневого ИИ сегодня неотделим от контроля агентов в реальном времени (runtime-контроль).

Что понадобится

  • Инвентаризация: полный список моделей, агентов, MCP-серверов и их связей в вашей инфраструктуре (INFERA называет это AI-BOM, по аналогии с перечнем компонентов в производстве)
  • Runtime-контроль: инструмент перехвата вызовов инструментов до их выполнения, например INFERA AI.SafeAgent или аналогичное решение
  • LLM Firewall: для контроля промптов и ответов на уровне модели (как дополнение, не замена)
  • Политики доступа: прописанные правила, что агенту можно, а что запрещено
  • Время: от нескольких часов на аудит до нескольких дней на внедрение, зависит от масштаба инфраструктуры

Пошаговая инструкция

  1. Проведите инвентаризацию всего ИИ в компании. Составьте реестр: какие модели используются, какие агенты запущены, к каким системам у них есть доступ, какие MCP-серверы работают. Без этого шага вы не знаете свой реальный периметр.

  2. Внедрите принцип «запрещено всё, что не разрешено» (deny-by-default). Каждый агент получает только минимально необходимые права. Нет явного разрешения на инструмент, значит, инструмент недоступен.

  3. Настройте перехват вызовов инструментов до выполнения. Используйте MCP-прокси или agent hooks (точки перехвата в коде агента). Система должна видеть имя инструмента и аргументы и выносить вердикт до того, как действие выполнится.

Пример политики (псевдокод):

rule: deny_by_default
  agent: *
  action: block

rule: allow_crm_read
  agent: sales_assistant
  tool: crm_api
  action: allow
  arguments:
    method: GET
    data_volume: < 100 records
  1. Изолируйте агентов. Каждый агент работает в отдельной среде, со своей идентичностью, без постоянных секретов (ключей доступа, паролей), с минимальными правами.

  2. Настройте эскалацию критических действий на человека. Для операций с высоким риском (массовое удаление, отправка данных наружу, изменение настроек безопасности) включите HITL (Human-in-the-Loop, одобрение человеком). Агент ставит действие в очередь, оператор подтверждает или отклоняет.

  3. Включите режим fail-closed. Если слой контроля недоступен (упал сервер политик, разорвалось соединение), все действия агента автоматически блокируются. Не «разрешить и залогировать потом», а именно заблокировать.

  4. Ведите полный журнал действий. Каждый вызов инструмента, каждый аргумент, каждое соединение фиксируются. Это нужно и для расследования инцидентов, и для аудита.

Как это выглядит на практике

Компания внедрила ИИ-агент для работы с почтой и CRM. Агент настроен с правом чтения писем и обновления карточек клиентов.

Без runtime-контроля: агент получает через indirect prompt injection (вредоносную инструкцию, спрятанную в тексте письма) команду выгрузить все контакты через легитимный API CRM. Firewall не срабатывает, потому что вызов идёт от авторизованного агента к разрешённому сервису. Данные уходят.

С runtime-контролем: MCP-прокси перехватывает вызов, видит аргумент «выгрузить все записи» (превышает лимит в 100 записей по политике), блокирует действие, ставит запрос в очередь HITL. Оператор SOC (центра мониторинга безопасности) видит аномалию, отклоняет, запускает расследование. Данные остаются на месте.

Частые ошибки

Считать LLM Firewall достаточной защитой. Firewall контролирует общение с моделью, но агент действует после этого этапа. Два слоя не дублируют, а дополняют друг друга.

Не проводить инвентаризацию. Если вы не знаете, сколько агентов и моделей работает в вашей компании, вы не можете их контролировать. «У нас ИИ пока нет» почти всегда неправда.

Давать агенту широкие права «для удобства». Принцип минимальных привилегий критичен. Агент с доступом к почте не должен иметь доступ к финансовой базе.

Оставлять режим fail-open. Если при сбое контроля агент продолжает работать без ограничений, одна авария превращается в полноценный инцидент.

Игнорировать локальные агенты. Desktop-ассистенты, IDE-плагины, MCP-инструменты на машинах разработчиков это полноценный теневой ИИ, который не видит сетевой Firewall.

Что делать с этим прямо сейчас, по ролям

Автору и контент-специалисту на Дзене. Если вы используете ИИ-ассистент, который сам публикует тексты, проверяйте, какие права он имеет. Доступ к аналитике канала, к черновикам, к интеграциям: каждый доступ это потенциальная точка утечки или ошибки. Минимум: убедитесь, что ассистент не имеет права удалять или массово редактировать опубликованный контент без вашего подтверждения.

Маркетологу. CRM-агенты, автоматические рассылки, интеграции с рекламными кабинетами: всё это уже работает через ИИ у многих команд. Начните с инвентаризации: какие ИИ-инструменты реально используют ваши сотрудники. Скорее всего, список удивит.

Предпринимателю и руководителю в РФ и СНГ. Решения класса INFERA AI.SafeAgent ориентированы пока на международный рынок. Из доступных в России шагов: провести аудит ИИ-инструментов внутри компании, настроить политики доступа для агентов средствами существующей инфраструктуры, ввести принцип «запрещено всё, что не разрешено» для любых автоматизаций с доступом к данным. Локальные решения от отечественных вендоров безопасности начинают появляться, но зрелых аналогов runtime-контроля агентов на рынке РФ пока мало.

Мнение редакции dzen.guru

По моим наблюдениям, большинство компаний в РФ и СНГ ещё не дошли до этапа контроля ИИ-агентов. Многие застряли на уровне «запретить ChatGPT на рабочих компьютерах». Это как запирать входную дверь, когда окна открыты.

Подход INFERA выглядит системным: два слоя защиты (Firewall для модели, runtime-контроль для агента), принцип минимальных привилегий, эскалация критических действий на человека. Я бы начал с самого простого: составить список всех ИИ-инструментов, которые ваши сотрудники реально используют. Результат почти гарантированно покажет, что «у нас ИИ нет» было самообманом.

Честная оговорка: runtime-контроль агентов это быстро развивающаяся категория, стандарты ещё не устоялись, а внедрение требует квалификации на стыке безопасности и машинного обучения. Не каждой компании это нужно прямо сейчас, но каждой нужна хотя бы инвентаризация.

Первый шаг не требует бюджета и вендора: откройте таблицу и запишите каждый ИИ-инструмент, который используют ваши сотрудники, с указанием, к каким данным и системам у него есть доступ. Этот список и есть ваш реальный периметр, а не тот, что нарисован в презентации для руководства.

Хотите разобраться, как ИИ-инструменты работают на практике?

В dzen.guru мы тестируем нейросети и агентов, делимся результатами и помогаем авторам использовать ИИ осознанно и безопасно.

Попробовать dzen.guru
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Что такое ИИ-агент без доверия: метод spec-review убрал ручное ревью 11 000 строк кода
ai

Что такое ИИ-агент без доверия: метод spec-review убрал ручное ревью 11 000 строк кода

Автоматизация бизнеса с помощью ИИ-агентов (программ, которые сами выполняют цепочку действий без команд на каждом шаге) упирается в одну проблему: код,…

6 мин
Meta запустила Pocket: создание игр без кода через промпты прямо в соцсети
ai

Meta запустила Pocket: создание игр без кода через промпты прямо в соцсети

Meta второго июня открыла для всех пользователей в США приложение Pocket, которое позволяет создавать небольшие интерактивные игры текстовыми промптами…

5 мин
Skala 1.1 ускоряет DFT вычисления: точность дорогих методов за цену полулокального функционала
ai

Skala 1.1 ускоряет DFT вычисления: точность дорогих методов за цену полулокального функционала

Microsoft Research обновила Skala до версии 1.1 и начала встраивать этот нейросетевой функционал в пять крупных пакетов вычислительной химии, включая CP2K,…

5 мин