Prompt injection это оружие без взлома: как атакующие крадут клиентов через ваш же контент
Компания OWASP (международная организация, занимающаяся безопасностью приложений) и исследователи из MIT, Google DeepMind и ETH Zurich в 2025 году зафиксировали волну атак нового типа: prompt injection, внедрение вредоносных инструкций в текст, картинку или аудио, которые ИИ принимает за команду.

Prompt injection это не взлом сервера и не кража пароля: атакующий прячет инструкцию прямо в обычный контент, а языковая модель выполняет её как легитимный запрос, потому что технически не умеет отличать данные от команд.
Угроза вышла за пределы лабораторий. Исследователи описали реальные сценарии, где жертвой становится не сама модель, а бренд: справочный центр компании превращается в фишинговую ловушку, конкурент перехватывает рекомендации ИИ-поиска, а автономный агент (программа, которая сама принимает решения и действует от имени пользователя) сливает данные клиентов. Источником фактов для этого материала служит разбор Search Engine Land, опирающийся на работы MIT CSAIL, Google DeepMind и ETH Zurich, а также на данные OWASP и подтверждённый инцидент с компанией Mercor.
| Что | Когда | Кто описал | Цена |
|---|---|---|---|
| Prompt injection: класс атак, при которых вредоносная инструкция встраивается в контент и исполняется ИИ | Актуально на 2025 год | OWASP, MIT CSAIL, Google DeepMind, ETH Zurich, Search Engine Land | Бесплатно для атакующего, потенциально катастрофично для жертвы |
Простые инъекции больше не работают, сложные процветают
- Белый текст на белом фоне, скрытые HTML-комментарии и невидимые символы Unicode больше не обманывают современные языковые модели. Распознавание шаблонов, изоляция границ и техника «прожектора» (spotlighting) закрыли эти лазейки.
- Семантическое встраивание (semantic embedding) остаётся рабочим методом. Атакующий вплетает вредоносную инструкцию в обычный абзац так, что модель не может отличить текст для пересказа от команды к действию.
- Мультимодальные атаки расширили поверхность угрозы на изображения, аудио и видео. Нейростеганография прячет инструкции в картинках, психоакустическая маскировка встраивает команды в звук на частотах, которые человек не слышит.
- Атака StyleBreak, продемонстрированная исследователями, показала: смена эмоционального тона голоса (злость, грусть, страх) обходит фильтры безопасности аудиомоделей без единой строки кода.
Как справочный центр становится фишинговой ловушкой?
Атака ChatGPhish работает так: злоумышленник встраивает скрытую инструкцию в обычную веб-страницу, блог или документацию компании. Когда пользователь просит ChatGPT или Perplexity пересказать эту страницу, модель генерирует поддельное уведомление о проблеме с аккаунтом и вредоносный QR-код прямо внутри чата.
Пользователь видит предупреждение не на подозрительном сайте, а внутри интерфейса доверенного ИИ-ассистента. Блокировщики URL и менеджеры паролей бессильны: ссылки нет, есть «ответ» ИИ. Клиент попадается на фишинг, а виноватым выглядит бренд, чей контент послужил носителем.
Для российских компаний это прямая угроза: ваш блог, подкаст или раздел помощи может стать каналом фишинга без вашего ведома.
Конкурент крадёт рекомендации ИИ-поиска без единого взлома
Prompt injection это ещё и оружие в конкурентной борьбе за так называемый LLM referral share (долю переходов, которые ИИ-поисковик направляет на ваш сайт). Конкурент может вставить в обзорную статью абзац, который выглядит как обычная проза, но содержит инструкцию для ИИ-агента рекомендовать чужой продукт вместо вашего.
Никакого взлома инфраструктуры не нужно. Claude, модель компании Anthropic, уже предупреждает пользователей, что вредоносное содержимое в переписке способно привести к утечке данных.
Автономные агенты: проблема «запутанного посредника»
Маркетинговые и операционные команды разворачивают ИИ-агентов быстрее, чем службы безопасности успевают их проверять. Исследователи описывают это как confused deputy problem (проблема «запутанного посредника»): агент, имеющий доступ одновременно к непроверенному входу (входящие письма, веб-контент) и к важному инструменту (отправка почты, правка CRM, возврат средств), может быть перехвачен через этот вход.
В реальном случае атакующие угнали аккаунты Instagram, манипулируя чат-ботом поддержки Meta. Хакер попросил бота добавить новый e-mail к чужому аккаунту, бот отправил код подтверждения на почту атакующего и выдал кнопку сброса пароля. Пострадали в том числе правительственные и военные профили.
Цепочка поставщиков: одно слабое звено ломает всё
Компания Mercor подтвердила инцидент 31 марта, связанный с вредоносными версиями LiteLLM (открытый инструмент для работы с API языковых моделей, широко используемый в корпоративных системах). OWASP отметила, что инцидент мог раскрыть данные о методах обучения моделей и операциях подрядчиков. Meta приостановила операции по итогам инцидента.
Если вы используете сторонних ИИ-поставщиков для обработки клиентских данных, компрометация одного из них выставляет ваши стратегии, сегменты аудитории и ценовую логику напоказ.
Главная рекомендация: двойная модель
Исследователи из MIT CSAIL, Google DeepMind и ETH Zurich (ведущие авторы Эдоардо Дебенедетти и Илья Шумайлов) рекомендуют архитектуру Dual-LLM: одна изолированная модель читает непроверенные входные данные, вторая выполняет бизнес-логику, и они никогда не делят общий слой обработки.
Сравнение: как обстоят дела в России?
| Параметр | Зарубежные модели (ChatGPT, Claude, Perplexity) | Российские модели (YandexGPT, GigaChat) |
|---|---|---|
| Подверженность prompt injection | Подтверждена исследованиями | Архитектурно уязвимы так же: проблема не в конкретной модели, а в принципе работы всех языковых моделей |
| Публичные инциденты | ChatGPhish, угон аккаунтов Instagram через Meta AI | Публичных разборов на момент публикации источника нет |
| Рекомендуемая защита | Dual-LLM, изоляция контуров | Применима без ограничений |
Отсутствие публичных инцидентов в России не означает отсутствие проблемы: prompt injection это свойство архитектуры любой языковой модели, а не уязвимость конкретного продукта.
Что делать прямо сейчас, по ролям
Автору Дзена и контент-маркетологу. Проверьте страницы, которые ИИ-поисковики чаще всего цитируют (справочные статьи, FAQ, инструкции). Именно они могут стать носителями скрытых инструкций. Если вы принимаете гостевые публикации или комментарии, любой внешний текст потенциально содержит вредоносную инструкцию для ИИ.
Маркетологу и предпринимателю. Запросите у IT-отдела аудит всех ИИ-агентов, которые имеют доступ одновременно к внешним данным и к внутренним системам (CRM, рассылки, возвраты). Если используете сторонние ИИ-сервисы, выясните, на какой модели они работают и прошли ли проверку безопасности.
Владельцу бизнеса в РФ и СНГ. Если у вас есть голосовой бот или IVR (система голосового меню), атака через эмоциональную модуляцию голоса (StyleBreak) может обойти фильтры. Обсудите с поставщиком, какие меры изоляции входных данных применены.
На мой взгляд, prompt injection это первая по-настоящему массовая угроза, которую невозможно закрыть патчем. Проблема в самом принципе работы языковых моделей: они обрабатывают инструкции и данные в одном потоке. Пока архитектура не изменится, любая компания, публикующая контент в интернете, невольно предоставляет атакующим площадку.
Оговорка: источник описывает преимущественно англоязычные сценарии. В русскоязычном сегменте атаки могут выглядеть иначе, но принцип идентичен.
Что сделать сегодня: откройте свой справочный центр или блог, попросите ChatGPT или YandexGPT пересказать любую страницу и посмотрите, не появится ли в ответе ничего, чего вы туда не закладывали. Это займёт пять минут и покажет, насколько ваш контент уязвим.
Частые вопросы
Prompt injection это то же самое, что jailbreak?
Нет. Jailbreak (взлом ограничений) направлен на саму модель: пользователь пытается заставить её обойти встроенные запреты. Prompt injection это атака через контент: вредоносная инструкция встроена в текст, картинку или аудио, которые модель обрабатывает. Жертвой становится не модель, а пользователь или бренд.
Можно ли полностью защититься от prompt injection?
На момент публикации источника полной защиты не существует. Исследователи рекомендуют архитектуру Dual-LLM (разделение модели, читающей входные данные, и модели, выполняющей действия), но называют проблему структурным свойством, а не багом, который можно устранить обновлением.
Угрожает ли это малому бизнесу или только крупным компаниям?
Угрожает любому бизнесу, чей контент индексируется ИИ-поисковиками или чьи сотрудники используют ИИ-ассистентов для работы с внешними данными. Масштаб компании не влияет на уязвимость: атака направлена на модель, а не на инфраструктуру жертвы.
Чем раньше вы проведёте аудит точек, где ваш контент соприкасается с ИИ-системами, тем меньше шансов обнаружить проблему уже после того, как клиент получит фишинговое сообщение от вашего имени.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

40% ссылок в ИИ-поиске скрывают бренд: цитирование есть, узнаваемости нет
Фантомные цитирования: ИИ-поиск ссылается на вашу страницу, но не называет ваш бренд, и вы об этом даже не знаете. Почему это важно Около 40% ссылок в ответах…

Как издателям монетизировать видимость искусственного интеллекта
Российским издателям и авторам контента всё чаще приходится решать задачу, которая ещё два года назад не существовала: как превратить упоминание бренда в…

ChatGPT даёт ссылку в 22,6% ответов о путешествиях, но лишь в 4,8% об образовании
ChatGPT всё чаще отвечает со ссылками, и в нише путешествий каждый пятый ответ уже ведёт на внешний сайт, а в образовании ссылку получает лишь один из…
Комментарии