Безопасность нейросетей в продакшене: чек-лист из 12 пунктов для аудита ИИ-агентов
Если вы запускаете ИИ-агентов (программы, которые сами принимают решения и вызывают внешние инструменты) в рабочей среде, этот гайд поможет найти скрытые уязвимости и закрыть их по чек-листу из 12 пунктов, не привлекая внешних консультантов.

ИИ-агенты попадают в кодовые базы быстрее, чем службы безопасности успевают их отследить, а классические инструменты защиты приложений не видят угрозы, которые приходят не через код, а через промпт или описание инструмента на внешнем сервере.
Компания Mend.io опубликовала практическое руководство «Securing AI agents, MCP servers & LLM apps», которое закрывает разрыв между скоростью внедрения агентных систем и готовностью команд их защищать. Руководство построено вокруг трёх действий: увидеть, что важно; исправить приоритетное; защитить ИИ в продакшене. Ниже я разобрал ключевые шаги и адаптировал их для тех, кто работает с нейросетями в России и СНГ.
Что понадобится
- Доступ к репозиториям кода вашего проекта (GitHub, GitLab, Bitbucket или аналог)
- Доступ к логам сетевого трафика (для отслеживания вызовов к API моделей)
- Список сервисных аккаунтов и API-ключей в вашей инфраструктуре
- Python 3.8+ или Docker для развёртывания guardrails (защитных фильтров)
- Около 2 часов на первый аудит, далее автоматизация
Почему привычная защита приложений не работает с агентами?
Классическая безопасность приложений (AppSec) строилась на одном допущении: приложение делает ровно то, что написано в коде. ИИ-агенты ломают это допущение. Поведение агента складывается из модели, системного промпта (базовой инструкции, которую агент получает до начала диалога), извлечённого контекста, пользовательского ввода и инструментов, которые агент может вызвать. Два одинаковых развёртывания могут вести себя по-разному.
Угрозы тоже другие. Инъекция промпта (prompt injection, когда злоумышленник прячет вредоносную команду в данных, а не в коде) приходит через текст, а не через уязвимость. Агент с избыточными правами может навредить без эксплуатации какой-либо дыры. Отравленное описание инструмента на MCP-сервере (сервере, который связывает агента с внешними инструментами по протоколу Model Context Protocol) способно перенаправить поведение агента, вообще не трогая само приложение.
Ни одна из этих угроз не появляется в стандартных базах уязвимостей.
Пошаговая инструкция: аудит за 12 пунктов
Шаг 1. Нарисуйте карту поверхности атаки по пяти слоям
По методике Mend.io, каждый ИИ-проект в продакшене имеет пять слоёв риска:
- Взаимодействие: пользовательский ввод, документы из базы знаний, сообщения между агентами. Риски: инъекция промпта, отравление контекста, утечка данных
- Агент: системные промпты, настройки, память, уровень автономии. Риски: избыточные права, небезопасные настройки по умолчанию, подмена цели
- Интеграция: MCP-серверы, описания инструментов, плагины, API. Риски: отравленные описания инструментов, «теневые» серверы без владельца
- Модель: базовые и дообученные (fine-tuned, обученные на ваших данных под узкую задачу) модели, эмбеддинги. Риски: устаревшие модели без поддержки, атаки на цепочку поставок
- Код: сгенерированный ИИ код, фреймворки, SDK. Риски: уязвимости в сгенерированном коде, вредоносные пакеты
Шаг 2. Найдите «теневых» агентов
Агенты редко приходят через закупки. Три категории для поиска: теневые агенты (запущенные разработчиками без согласования), незарегистрированные MCP-серверы, встроенные ИИ-фреймворки.
Пять методов обнаружения:
- Сканируйте репозитории на агентные сигнатуры:
# Пример поиска характерных импортов в Python-проектах
grep -rn "langchain\|autogen\|crewai\|mcp_server\|openai.Agent" ./src/
- Отслеживайте исходящий сетевой трафик к API моделей (api.openai.com, api.anthropic.com и другим эндпоинтам)
- Проведите аудит сервисных аккаунтов и API-ключей
- Сделайте регистрацию дешёвой: заведите простую форму, где разработчик за минуту вписывает агента в реестр
- Автоматизируйте сканирование: разовая проверка устаревает за дни
Шаг 3. Заполните расширенный реестр (AI-BOM) на каждого агента
По методике Mend.io, для каждого агента или MCP-сервера фиксируйте девять полей:
- Идентификатор агента
- Зависимость от модели (какая модель, какая версия)
- Уровень автономии
- Разрешения на инструменты
- Область доступа учётных данных
- Охват данных
- Эндпоинты MCP
- Расположение промпта
- Дата последней проверки
Шаг 4. Пройдите чек-лист из 12 пунктов на ошибки конфигурации
По руководству Mend.io этот чек-лист покрывает самые частые проблемы безопасности нейросетей в продакшене:
- Учётные данные привязаны к конкретным ресурсам, а не к широкому сервисному доступу
- Между агентами нет общих учётных данных
- Инструменты с высоким воздействием требуют одобрения человека
- Системные промпты хранятся в системе контроля версий, а не редактируются в продакшене
- MCP-серверы аутентифицируют клиентов
- Описания инструментов проверены на инъекционное содержимое до подключения (защита от отравления инструмента)
- Версии моделей зафиксированы, настроен мониторинг окончания поддержки, назначен владелец
Остальные пять пунктов касаются политик автозакрытия, логирования и ротации ключей.
Шаг 5. Настройте приоритизацию находок
Конвейер: обогащение данных, приоритизация, разбор. Сигналы приоритизации в порядке ценности:
- Достижимость уязвимости из внешней сети
- Контекст эксплуатируемости
- Бизнес-контекст
- Агентное усиление (может ли агент масштабировать ущерб)
- Доступность исправления
Два правила автоматизации: каждое автоматическое закрытие сопровождается доказательством (если система не может объяснить, почему это ложное срабатывание, находка уходит к человеку), а частоту ошибок проверяют выборочно, с порогами, при превышении которых запускается переобучение.
Шаг 6. Разверните защитные фильтры (guardrails)
Два варианта развёртывания:
# Вариант 1: Python SDK (встраивается в приложение)
from mend_guardrails import InboundGuard, OutboundGuard
inbound = InboundGuard(mode="online") # или "offline" для изоляции
outbound = OutboundGuard()
# Вариант 2: Docker API Server (без изменений кода)
docker run -p 8080:8080 mend/guardrails-server:latest
Минимальный набор: входящие фильтры ловят инъекции промптов, запросы вне политики и попытки «джейлбрейка» (обхода ограничений модели). Исходящие фильтры перехватывают утечку учётных данных, персональных данных, проприетарного кода и небезопасного контента.
Шаг 7. Укрепите системные промпты
Пять принципов по методике Mend.io:
- Исходите из того, что промпт будет раскрыт
- Отделяйте инструкции от данных
- Ограничивайте «радиус поражения» (что агент вообще может сделать)
- Храните промпты в системе версий и проводите ревью
- Тестируйте состязательно (adversarial testing)
Ключевой вывод из руководства: строгие разрешения эффективнее, чем инструкции в промпте. Если агенту физически закрыт доступ к инструменту, не нужно просить его «не использовать этот инструмент».
Как оценить зрелость вашей защиты?
Mend.io предлагает четыре стадии зрелости: начальная (Emerging), развивающаяся (Developing), контролирующая (Controlling) и ведущая (Leading). Шкала выровнена с NIST AI RMF, OWASP AIMA, ISO/IEC 42001 и Актом ЕС об ИИ (EU AI Act, европейский закон, регулирующий разработку и применение систем ИИ).
Самооценка по 15 вопросам: 0 до 5 баллов означает начальную стадию, от 6 до 10 развивающуюся, от 11 до 13 контролирующую, от 14 до 15 ведущую.
Допустим, вы ведёте Дзен-канал и используете ИИ-агента для автоматической обработки комментариев. Запускаете grep по репозиторию, находите импорт openai в скрипте, о котором забыл разработчик. Проверяете по чек-листу: API-ключ один на все сервисы (пункт 2, нарушение), системный промпт зашит в коде без версионирования (пункт 4, нарушение), модель не зафиксирована по версии (пункт 7, нарушение). Три исправления за полчаса без внешнего аудитора.
Разовый аудит вместо постоянного мониторинга. Состав агентов и MCP-серверов меняется каждую неделю. Результаты однократной проверки устаревают за дни.
Надежда на промпт вместо разрешений. Написать в промпте «не удаляй файлы» не равно отозвать у агента права на удаление. Строгие разрешения закрывают риск, инструкции лишь снижают вероятность.
Общие ключи между агентами. Если один агент скомпрометирован, злоумышленник получает доступ ко всем сервисам, к которым подключены остальные.
Игнорирование описаний инструментов на MCP-серверах. Отравленное описание инструмента перенаправляет агента незаметно. Проверяйте описания до подключения, а не после инцидента.
Что делать с этим прямо сейчас, по ролям
Автору Дзена. Если вы подключаете ИИ-ассистента для генерации текстов или обработки аналитики канала, пройдите хотя бы первые четыре пункта чек-листа. Убедитесь, что API-ключ не «гуляет» по разным сервисам и что системный промпт хранится в файле, а не вбит руками в интерфейс.
Маркетологу. Безопасность нейросетей в ваших рабочих процессах напрямую связана с утечкой клиентских данных. Если агент обрабатывает лиды или переписку, проверьте исходящие фильтры: утечка персональных данных через ответ модели реальна и не требует взлома.
Предпринимателю в РФ и СНГ. Руководство Mend.io ориентировано на западный стек, но логика универсальна. Если вы используете YandexGPT, GigaChat или открытые модели через Ollama, те же пять слоёв атаки и тот же чек-лист применимы. Регуляторных требований по безопасности ИИ-агентов в России пока нет в формате EU AI Act, но ФЗ-152 о персональных данных уже покрывает утечки через ИИ.
Этот гайд от Mend.io, по моим наблюдениям, один из немногих, где безопасность нейросетей разобрана не через абстрактные угрозы, а через конкретные поля реестра и пункты чек-листа. Самое ценное: разделение «промпт не заменяет разрешения». Я вижу, как разработчики в РФ полагаются на инструкцию в системном промпте как на замок, хотя это скорее табличка «не входить». Честная оговорка: руководство продвигает инструменты самой Mend.io, поэтому конкретные команды для SDK стоит проверять на актуальность в документации. Но методология и чек-лист работают независимо от вендора.
Начните с команды grep по вашим репозиториям и чек-листа из 12 пунктов. Если обнаружите хотя бы одного «теневого» агента, вы уже окупили два часа аудита.
Курс по нейросетям для авторов
Разберитесь, как безопасно использовать ИИ-агентов в работе с контентом
Узнать подробности
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Конгресс США потратил на ChatGPT $100 580 за год: 90% всех расходов на ИИ
ChatGPT получает 90% всех расходов Конгресса США на ИИ-инструменты, и это не просто статистика, а сигнал о том, какой сервис выбирают для реальной работы с…

June привлекла $20 млн на автоматическое развёртывание ИИ: стартап заменяет выездных инженеров
Почему это важно Развёртывание ИИ в крупных компаниях упирается не в саму модель, а в хаос корпоративных систем. June автоматизирует именно эту работу и…

Alibaba конкурирует с американским искусственным интеллектом
Alibaba 2 июня опубликовала Qwen3.8-Max, свою крупнейшую языковую модель с 2,4 триллиона параметров и открытыми весами (открытые веса, это когда разработчик…
Комментарии