ИИ в информационной безопасности: куда попадают файлы из ChatGPT и почему это кадровый риск
Договор с клиентом, фрагмент кода, медицинская карта: каждый день пользователи нейросетей загружают данные, которые никогда бы не отправили незнакомцу, а редактор «Рейтинга Рунета» Дарья Лушкина вместе с техническим директором интегратора R77 AI Ярославом Шмулёвым разобрали, куда эти данные физически попадают и на каких этапах становятся уязвимыми.
В 2025 году сотрудники российских компаний загрузили в публичные нейросети в 30 раз больше корпоративных данных, чем годом ранее, а топ-менеджера уже уволили и проиграла суд за отправку служебных документов в DeepSeek. ИИ в информационной безопасности перестал быть абстрактной темой и стал кадровым и юридическим риском.
Исследование провела Дарья Лушкина, редактор и исследователь аналитической платформы «Рейтинг Рунета», которая ежегодно собирает финансовые показатели, данные о заказчиках и экспертизу компаний-участников. Когда команда решила подключить нейросети к анализу данных рейтинга, возник практический вопрос: загрузка во внешний сервис уже считается раскрытием конфиденциальной информации? Техническую сторону объяснил Ярослав Шмулёв, технический директор интегратора R77 AI.
| Показатель | Значение | Источник |
|---|---|---|
| Рост объёма корпоративных данных в публичных нейросетях (2025 vs 2024) | В 30 раз | Исследование, на которое ссылается Дарья Лушкина (анализ трафика 150 российских компаний) |
| Доля компаний без правил работы с ИИ-сервисами | 60 % | То же исследование |
| Прецедент увольнения за загрузку документов в DeepSeek | Суд встал на сторону работодателя, квалифицировав загрузку как разглашение коммерческой тайны | Случай с топ-менеджером московской инженерной компании, июль 2025 |
Что именно изучали?
Лушкина поставила три вопроса, с которыми сталкивается любой, кто работает с конфиденциальными данными и хочет использовать ИИ в информационной безопасности или хотя бы для рутинного анализа документов:
- Куда физически попадают загруженные файлы?
- Кто получает к ним доступ на каждом этапе?
- Что реально происходит после нажатия кнопки «удалить»?
Метод прямой: интервью с техническим специалистом, который объяснил внутреннюю механику обработки файлов на примере загрузки договора в ChatGPT. Это не лабораторный эксперимент с контрольной группой, а практический разбор архитектуры, но именно он показывает, сколько копий данных возникает за одну операцию.
Куда попадает файл после загрузки?
Шмулёв описал цепочку, которую проходит, например, договор с клиентом, загруженный в ChatGPT с просьбой «найди риски».
- Приём и сохранение. Файл попадает на сервер, проверяется, логируется, сохраняется в хранилище и привязывается к конкретному пользователю и диалогу.
- Извлечение текста. Из PDF или Word-документа вытягиваются текст, таблицы, заголовки, сноски. Если загружен скан, дополнительно работает OCR (распознавание текста с картинки). Модель не «читает файл» напрямую: сервис сначала превращает его в текст.
- Разбивка на фрагменты. У моделей есть ограничение по объёму контекста (сколько текста модель способна «видеть» за один раз). Большой договор целиком не поместится, поэтому сервис делит текст на части и передаёт модели только те, что нужны для ответа на конкретный вопрос.
- Формирование запроса и ответ. Собираются вместе инструкция пользователя, системные правила сервиса и выбранные фрагменты. Модель генерирует ответ и возвращает его в интерфейс.
После одной загрузки данные существуют сразу в нескольких формах: исходный файл, извлечённый текст, фрагменты текста, эмбеддинги (векторные представления смысла, благодаря которым система понимает, что «корова» и «молоко» ближе друг к другу, чем «корова» и «поезд»), логи обработки и служебные метаданные.
Где данные наиболее уязвимы?
Шмулёв выделяет четыре критических точки:
- Хранилище исходного файла. Пока договор лежит на серверах сервиса в первоначальном виде, коммерческая тайна, персональные данные, реквизиты и условия сделки доступны как обычный файл на стороне внешней компании.
- Логи и служебные хранилища. Кто загрузил файл, когда, какой был запрос, какие фрагменты извлечены. Иногда в логах оказывается часть содержимого документа, о чём пользователь даже не подозревает.
- Цепочка третьих сторон. Облачные провайдеры, подрядчики по модерации и аналитике качества. Никто не обязательно читает документ вручную, но с каждым звеном цепочка доступа удлиняется.
- Попадание в обучающие данные. Если файл отобрали для дообучения (обучения модели на новых примерах для улучшения качества), удалить его последствия гораздо сложнее. Сам документ может уже не храниться внутри модели, но он мог повлиять на её параметры, то есть на то, как модель формулирует ответы.
Шмулёв подчёркивает: «файл загружен» и «файл попал в обучение» это разные события, которые часто путают. Данные могут просто храниться для работы сервиса и только при определённых условиях отбираться для дообучения.
Реальные последствия уже наступили
В июле 2025 года топ-менеджера московской инженерной компании уволили за загрузку служебных документов в DeepSeek. Суд встал на сторону работодателя: загрузку квалифицировали как разглашение коммерческой тайны. Это не теоретический сценарий, а судебный прецедент с конкретными карьерными последствиями.
При этом, по данным того же исследования трафика 150 компаний, 60 % организаций до сих пор не имеют никаких внутренних правил работы с ИИ-сервисами. Сотрудники просто пользуются, не задумываясь, что именно они отдают и кому.
Исследование трафика 150 компаний, на которое ссылается Лушкина, не уточняет единицу измерения роста в 30 раз: гигабайты, токены или количество запросов. Сам разбор архитектуры основан на интервью с одним техническим экспертом и описывает общую логику, а не аудит конкретного сервиса. Судебный случай с DeepSeek подтверждён как факт, но детали дела (какие именно документы, какой суд) в материале не раскрыты.
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Прежде чем загрузить текст клиента в ChatGPT или другую нейросеть для редактуры, уберите из него имена, реквизиты, суммы и любые данные, по которым можно идентифицировать заказчика. Даже если сервис обещает не использовать данные для обучения, логи и метаданные остаются.
Маркетологам. Если вы загружаете аналитику, презентации с цифрами продаж или стратегии в публичные нейросети, вы технически передаёте их на серверы за пределами вашего контроля. Поднимите вопрос внутренней политики работы с ИИ-сервисами: по данным исследования, 60 % компаний этого до сих пор не сделали.
Предпринимателям в РФ и СНГ. Увольнение за загрузку в DeepSeek устояло в суде. Если у вашей компании нет регламента, что можно и чего нельзя отправлять в нейросети, любой сотрудник может стать и нарушителем, и жертвой одновременно. Из российских сервисов доступны YandexGPT и GigaChat, данные в которых хранятся на территории РФ, но и для них нужны внутренние правила.
Я вижу, как авторы каждый день загружают в нейросети черновики, ТЗ от клиентов, таблицы с выручкой и даже сканы паспортов «для распознавания». По моим наблюдениям, большинство вообще не различают локальную модель и облачный сервис: для них это одна кнопка. Материал Лушкиной ценен не глубиной технического анализа, а тем, что впервые на русском языке простым языком показана вся цепочка: от загрузки до попадания в обучающие данные. Судебный прецедент с DeepSeek должен отрезвить. Минимальный шаг: до загрузки любого файла спросите себя, готовы ли вы отправить его незнакомому человеку. Если нет, не отправляйте и нейросети.
Прецедент с увольнением за DeepSeek показал: российские суды уже квалифицируют загрузку в публичную нейросеть как разглашение. Регламент работы с ИИ-сервисами перестал быть «хорошей практикой» и стал юридической необходимостью, и тот, кто составит его первым, защитит и компанию, и себя.
По данным «Рейтинга Рунета»

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

REST API нейросети за 40 минут: как автоматизировать нормализацию номенклатуры в 1С и SAP
Если REST API (программный интерфейс, через который одна система отправляет запросы другой по сети) нейросети звучит как нечто из мира разработчиков, то эта…

Авторство кода нейросети: как понять, где ваше решение, а где чужое
Авторство кода нейросети перестало быть абстрактным вопросом для философов: разработчики, копирайтеры и все, кто делегирует создание текстов или программ…

Искусственный интеллект на производстве: план за 3 минуты вместо часов в Excel
Производственное планирование перестаёт зависеть от интуиции диспетчера и аврального пересчёта в Excel: искусственный интеллект на производстве уже берёт на…
Комментарии