Игорь Градов
Игорь Градов
7 мин
ai

Безопасность нейросетей в продакшене: чек-лист из 12 пунктов для аудита ИИ-агентов

Если вы запускаете ИИ-агентов (программы, которые сами принимают решения и вызывают внешние инструменты) в рабочей среде, этот гайд поможет найти скрытые уязвимости и закрыть их по чек-листу из 12 пунктов, не привлекая внешних консультантов.

Безопасность нейросетей в продакшене: чек-лист из 12 пунктов для аудита ИИ-агентов
Почему это важно

ИИ-агенты попадают в кодовые базы быстрее, чем службы безопасности успевают их отследить, а классические инструменты защиты приложений не видят угрозы, которые приходят не через код, а через промпт или описание инструмента на внешнем сервере.

Компания Mend.io опубликовала практическое руководство «Securing AI agents, MCP servers & LLM apps», которое закрывает разрыв между скоростью внедрения агентных систем и готовностью команд их защищать. Руководство построено вокруг трёх действий: увидеть, что важно; исправить приоритетное; защитить ИИ в продакшене. Ниже я разобрал ключевые шаги и адаптировал их для тех, кто работает с нейросетями в России и СНГ.

Что понадобится

  • Доступ к репозиториям кода вашего проекта (GitHub, GitLab, Bitbucket или аналог)
  • Доступ к логам сетевого трафика (для отслеживания вызовов к API моделей)
  • Список сервисных аккаунтов и API-ключей в вашей инфраструктуре
  • Python 3.8+ или Docker для развёртывания guardrails (защитных фильтров)
  • Около 2 часов на первый аудит, далее автоматизация

Почему привычная защита приложений не работает с агентами?

Классическая безопасность приложений (AppSec) строилась на одном допущении: приложение делает ровно то, что написано в коде. ИИ-агенты ломают это допущение. Поведение агента складывается из модели, системного промпта (базовой инструкции, которую агент получает до начала диалога), извлечённого контекста, пользовательского ввода и инструментов, которые агент может вызвать. Два одинаковых развёртывания могут вести себя по-разному.

Угрозы тоже другие. Инъекция промпта (prompt injection, когда злоумышленник прячет вредоносную команду в данных, а не в коде) приходит через текст, а не через уязвимость. Агент с избыточными правами может навредить без эксплуатации какой-либо дыры. Отравленное описание инструмента на MCP-сервере (сервере, который связывает агента с внешними инструментами по протоколу Model Context Protocol) способно перенаправить поведение агента, вообще не трогая само приложение.

Ни одна из этих угроз не появляется в стандартных базах уязвимостей.

Пошаговая инструкция: аудит за 12 пунктов

Шаг 1. Нарисуйте карту поверхности атаки по пяти слоям

По методике Mend.io, каждый ИИ-проект в продакшене имеет пять слоёв риска:

  • Взаимодействие: пользовательский ввод, документы из базы знаний, сообщения между агентами. Риски: инъекция промпта, отравление контекста, утечка данных
  • Агент: системные промпты, настройки, память, уровень автономии. Риски: избыточные права, небезопасные настройки по умолчанию, подмена цели
  • Интеграция: MCP-серверы, описания инструментов, плагины, API. Риски: отравленные описания инструментов, «теневые» серверы без владельца
  • Модель: базовые и дообученные (fine-tuned, обученные на ваших данных под узкую задачу) модели, эмбеддинги. Риски: устаревшие модели без поддержки, атаки на цепочку поставок
  • Код: сгенерированный ИИ код, фреймворки, SDK. Риски: уязвимости в сгенерированном коде, вредоносные пакеты

Шаг 2. Найдите «теневых» агентов

Агенты редко приходят через закупки. Три категории для поиска: теневые агенты (запущенные разработчиками без согласования), незарегистрированные MCP-серверы, встроенные ИИ-фреймворки.

Пять методов обнаружения:

  1. Сканируйте репозитории на агентные сигнатуры:
# Пример поиска характерных импортов в Python-проектах
grep -rn "langchain\|autogen\|crewai\|mcp_server\|openai.Agent" ./src/
  1. Отслеживайте исходящий сетевой трафик к API моделей (api.openai.com, api.anthropic.com и другим эндпоинтам)
  2. Проведите аудит сервисных аккаунтов и API-ключей
  3. Сделайте регистрацию дешёвой: заведите простую форму, где разработчик за минуту вписывает агента в реестр
  4. Автоматизируйте сканирование: разовая проверка устаревает за дни

Шаг 3. Заполните расширенный реестр (AI-BOM) на каждого агента

По методике Mend.io, для каждого агента или MCP-сервера фиксируйте девять полей:

  • Идентификатор агента
  • Зависимость от модели (какая модель, какая версия)
  • Уровень автономии
  • Разрешения на инструменты
  • Область доступа учётных данных
  • Охват данных
  • Эндпоинты MCP
  • Расположение промпта
  • Дата последней проверки

Шаг 4. Пройдите чек-лист из 12 пунктов на ошибки конфигурации

По руководству Mend.io этот чек-лист покрывает самые частые проблемы безопасности нейросетей в продакшене:

  1. Учётные данные привязаны к конкретным ресурсам, а не к широкому сервисному доступу
  2. Между агентами нет общих учётных данных
  3. Инструменты с высоким воздействием требуют одобрения человека
  4. Системные промпты хранятся в системе контроля версий, а не редактируются в продакшене
  5. MCP-серверы аутентифицируют клиентов
  6. Описания инструментов проверены на инъекционное содержимое до подключения (защита от отравления инструмента)
  7. Версии моделей зафиксированы, настроен мониторинг окончания поддержки, назначен владелец

Остальные пять пунктов касаются политик автозакрытия, логирования и ротации ключей.

Шаг 5. Настройте приоритизацию находок

Конвейер: обогащение данных, приоритизация, разбор. Сигналы приоритизации в порядке ценности:

  1. Достижимость уязвимости из внешней сети
  2. Контекст эксплуатируемости
  3. Бизнес-контекст
  4. Агентное усиление (может ли агент масштабировать ущерб)
  5. Доступность исправления

Два правила автоматизации: каждое автоматическое закрытие сопровождается доказательством (если система не может объяснить, почему это ложное срабатывание, находка уходит к человеку), а частоту ошибок проверяют выборочно, с порогами, при превышении которых запускается переобучение.

Шаг 6. Разверните защитные фильтры (guardrails)

Два варианта развёртывания:

# Вариант 1: Python SDK (встраивается в приложение)
from mend_guardrails import InboundGuard, OutboundGuard

inbound = InboundGuard(mode="online")  # или "offline" для изоляции
outbound = OutboundGuard()
# Вариант 2: Docker API Server (без изменений кода)
docker run -p 8080:8080 mend/guardrails-server:latest

Минимальный набор: входящие фильтры ловят инъекции промптов, запросы вне политики и попытки «джейлбрейка» (обхода ограничений модели). Исходящие фильтры перехватывают утечку учётных данных, персональных данных, проприетарного кода и небезопасного контента.

Шаг 7. Укрепите системные промпты

Пять принципов по методике Mend.io:

  1. Исходите из того, что промпт будет раскрыт
  2. Отделяйте инструкции от данных
  3. Ограничивайте «радиус поражения» (что агент вообще может сделать)
  4. Храните промпты в системе версий и проводите ревью
  5. Тестируйте состязательно (adversarial testing)

Ключевой вывод из руководства: строгие разрешения эффективнее, чем инструкции в промпте. Если агенту физически закрыт доступ к инструменту, не нужно просить его «не использовать этот инструмент».

Как оценить зрелость вашей защиты?

Mend.io предлагает четыре стадии зрелости: начальная (Emerging), развивающаяся (Developing), контролирующая (Controlling) и ведущая (Leading). Шкала выровнена с NIST AI RMF, OWASP AIMA, ISO/IEC 42001 и Актом ЕС об ИИ (EU AI Act, европейский закон, регулирующий разработку и применение систем ИИ).

Самооценка по 15 вопросам: 0 до 5 баллов означает начальную стадию, от 6 до 10 развивающуюся, от 11 до 13 контролирующую, от 14 до 15 ведущую.

Как это применить на практике

Допустим, вы ведёте Дзен-канал и используете ИИ-агента для автоматической обработки комментариев. Запускаете grep по репозиторию, находите импорт openai в скрипте, о котором забыл разработчик. Проверяете по чек-листу: API-ключ один на все сервисы (пункт 2, нарушение), системный промпт зашит в коде без версионирования (пункт 4, нарушение), модель не зафиксирована по версии (пункт 7, нарушение). Три исправления за полчаса без внешнего аудитора.

Частые ошибки

Разовый аудит вместо постоянного мониторинга. Состав агентов и MCP-серверов меняется каждую неделю. Результаты однократной проверки устаревают за дни.

Надежда на промпт вместо разрешений. Написать в промпте «не удаляй файлы» не равно отозвать у агента права на удаление. Строгие разрешения закрывают риск, инструкции лишь снижают вероятность.

Общие ключи между агентами. Если один агент скомпрометирован, злоумышленник получает доступ ко всем сервисам, к которым подключены остальные.

Игнорирование описаний инструментов на MCP-серверах. Отравленное описание инструмента перенаправляет агента незаметно. Проверяйте описания до подключения, а не после инцидента.

Что делать с этим прямо сейчас, по ролям

Автору Дзена. Если вы подключаете ИИ-ассистента для генерации текстов или обработки аналитики канала, пройдите хотя бы первые четыре пункта чек-листа. Убедитесь, что API-ключ не «гуляет» по разным сервисам и что системный промпт хранится в файле, а не вбит руками в интерфейс.

Маркетологу. Безопасность нейросетей в ваших рабочих процессах напрямую связана с утечкой клиентских данных. Если агент обрабатывает лиды или переписку, проверьте исходящие фильтры: утечка персональных данных через ответ модели реальна и не требует взлома.

Предпринимателю в РФ и СНГ. Руководство Mend.io ориентировано на западный стек, но логика универсальна. Если вы используете YandexGPT, GigaChat или открытые модели через Ollama, те же пять слоёв атаки и тот же чек-лист применимы. Регуляторных требований по безопасности ИИ-агентов в России пока нет в формате EU AI Act, но ФЗ-152 о персональных данных уже покрывает утечки через ИИ.

Мнение редакции dzen.guru

Этот гайд от Mend.io, по моим наблюдениям, один из немногих, где безопасность нейросетей разобрана не через абстрактные угрозы, а через конкретные поля реестра и пункты чек-листа. Самое ценное: разделение «промпт не заменяет разрешения». Я вижу, как разработчики в РФ полагаются на инструкцию в системном промпте как на замок, хотя это скорее табличка «не входить». Честная оговорка: руководство продвигает инструменты самой Mend.io, поэтому конкретные команды для SDK стоит проверять на актуальность в документации. Но методология и чек-лист работают независимо от вендора.

Начните с команды grep по вашим репозиториям и чек-листа из 12 пунктов. Если обнаружите хотя бы одного «теневого» агента, вы уже окупили два часа аудита.

Курс по нейросетям для авторов

Разберитесь, как безопасно использовать ИИ-агентов в работе с контентом

Узнать подробности
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Конгресс США потратил на ChatGPT $100 580 за год: 90% всех расходов на ИИ
ai

Конгресс США потратил на ChatGPT $100 580 за год: 90% всех расходов на ИИ

ChatGPT получает 90% всех расходов Конгресса США на ИИ-инструменты, и это не просто статистика, а сигнал о том, какой сервис выбирают для реальной работы с…

4 мин
June привлекла $20 млн на автоматическое развёртывание ИИ: стартап заменяет выездных инженеров
ai

June привлекла $20 млн на автоматическое развёртывание ИИ: стартап заменяет выездных инженеров

Почему это важно Развёртывание ИИ в крупных компаниях упирается не в саму модель, а в хаос корпоративных систем. June автоматизирует именно эту работу и…

5 мин
Alibaba конкурирует с американским искусственным интеллектом
ai

Alibaba конкурирует с американским искусственным интеллектом

Alibaba 2 июня опубликовала Qwen3.8-Max, свою крупнейшую языковую модель с 2,4 триллиона параметров и открытыми весами (открытые веса, это когда разработчик…

5 мин