Игорь Градов
Игорь Градов
6 мин
ai

Скрейпинг данных для нейросети назвали «кражей» сами топы Microsoft и OpenAI

Microsoft второго июня потеряла часть судебной защиты: рассекреченные документы по иску The New York Times показали, что топ-менеджеры компании и OpenAI называли скрейпинг данных нейросети «кражей» и признавали угрозу для издателей.

Скрейпинг данных для нейросети назвали «кражей» сами топы Microsoft и OpenAI
Почему это важно

Впервые внутренние документы двух крупнейших ИИ-компаний открыто противоречат их же юридической позиции о «добросовестном использовании», и это касается любого автора, чей контент мог попасть в обучающие данные (training data, тексты, на которых учат модель).

Иск The New York Times к OpenAI и Microsoft длится три года. Газета утверждает, что компании нарушили авторское право, обучая генеративные модели на её материалах. До сих пор обе стороны спорили абстрактно: подпадает ли такое использование под доктрину fair use (добросовестное использование, правило в праве США, позволяющее цитировать чужие работы без разрешения для пародии, критики или новостей). Теперь суд снял гриф с части переписки и презентаций, и картина стала конкретной. Источник новых данных, судебная записка The New York Times, опубликованная TechCrunch. Сами вещественные доказательства пока засекречены, поэтому цитаты приводятся без исходного контекста.

Что Когда Кто участвует Цена вопроса
Рассекречены внутренние документы по иску NYT против OpenAI и Microsoft Документы стали публичными в июне 2025 года, иск подан три года назад The New York Times (истец), OpenAI и Microsoft (ответчики) Сумму компенсации суд пока не определил

Что стало известно из рассекреченных документов?

  • Топ-менеджер Microsoft назвал скрейпинг «кражей». Директор прикладных наук Microsoft Брент Хехт в январе 2023 года написал во внутренней записке, что скрейпинг данных нейросети, это «поразительная кража беспрецедентного масштаба» и «крупнейшая кража труда в истории человечества».

  • Руководитель ChatGPT признал «экзистенциальную угрозу» для издателей. Ник Тёрли, глава ChatGPT в OpenAI, написал во внутренней переписке, что продукты вроде чат-бота «в значительной степени замещают» оригинальные источники и «будут замещать всё сильнее по мере улучшения».

  • Клики на сайт NYT упали до 93%. Собственные данные Microsoft показали, что «движок ответов» Copilot снизил переходы на домен nytimes.com до 93% по сравнению с обычным поиском Bing. Внутренняя презентация Хехта описывает это как «петлю гибели», которая «одновременно ударит по качеству наших моделей и по всему вебу».

  • Сатья Наделла дал показания под присягой. Глава Microsoft заявил, что «всё, что стоит за пейволлом (платной подпиской), должно лицензироваться любым, кто хочет это использовать для обучения или заземления моделей». Он добавил, что потребовал бы от OpenAI переобучить модели, если бы узнал о скрейпинге платного контента.

  • OpenAI обходила пейволлы целенаправленно. Исследователь OpenAI Ник Райдер сообщил президенту компании Грегу Брокману о «хаке для обхода пейвола NYT», на что Брокман ответил: «о, отлично».

  • Масштаб копирования огромен. Только промежуточные наборы обучающих данных OpenAI содержат более 91 692 копий работ NYT, Daily News и Центра журналистских расследований. Набор на основе Common Crawl (открытый репозиторий веб-данных) включал более 2 миллионов документов только с nytimes.com.

  • Копирайт-уведомления удаляли специально. Исследователи OpenAI убирали знаки авторского права из обучающих данных, потому что «не хотели, чтобы модель выдавала копирайт-уведомления пользователям».

  • Microsoft и OpenAI обменивались данными. OpenAI передала Microsoft весь набор обучающих данных GPT-3. Microsoft в ответ предоставила данные через проекты Project Taxi и Project Mango. Один только набор Project Mango содержит копии не менее 160 903 уникальных работ новостных издателей.

Почему fair use под вопросом?

Доктрина добросовестного использования требует, чтобы новый продукт не замещал оригинал и не вредил его рынку. Рассекреченные цитаты бьют именно по этому условию. Президент OpenAI Брокман назвал модели «превосходными в новостях». Наделла согласился под присягой, что общение с чат-ботами «заместило потребность переходить на сайт-источник».

Параллельно администрация Трампа подала записку в защиту позиции OpenAI о допустимости нелицензированного использования. Суды пока в целом склонялись в пользу ИИ-компаний, но новые внутренние документы могут изменить баланс аргументов.

Обе компании не ответили на запросы TechCrunch о комментарии.

Сравнение с ситуацией в России

В России крупные модели, YandexGPT и GigaChat от Сбера, тоже обучаются на текстовых данных из интернета. Публичных исков, аналогичных делу NYT, пока не было. Российское законодательство об авторском праве не содержит доктрины fair use в американском смысле, зато включает исключения для научных и информационных целей, но их границы для обучения нейросетей не проверены судами.

Для авторов из РФ и СНГ дело NYT создаёт прецедент: если американский суд признает скрейпинг данных нейросети нарушением, это может повлиять на мировую практику лицензирования контента, включая русскоязычный.

Что делать с этим прямо сейчас, по ролям

  • Автору Дзена. Проверьте, индексируется ли ваш контент в Common Crawl (сайт commoncrawl.org позволяет искать по домену). Если ваши тексты там есть, они потенциально попали в обучающие наборы. Файл robots.txt с запретом для ботов OpenAI (GPTBot) и Google-Extended хотя бы фиксирует вашу позицию.

  • Маркетологу и контент-менеджеру. Следите за исходом дела: если суд обяжет лицензировать контент, стоимость ИИ-сервисов вырастет, а ценность оригинального текста, соответственно, тоже. Это аргумент против стратегии «заменим редакцию нейросетью».

  • Предпринимателю. Если вы строите продукт на базе LLM (большая языковая модель, нейросеть, генерирующая текст) и используете чужой контент для дообучения, фиксируйте источники и лицензии сейчас. Даже внутренние записки могут стать доказательствами, как показал этот кейс.

Мнение редакции dzen.guru

На мой взгляд, рассекреченные документы, это самый сильный аргумент авторов и издателей за три года спора. Не потому что суд уже решил в их пользу, а потому что собственные сотрудники Microsoft и OpenAI говорят то, что юристы компаний отрицают в зале суда.

Для русскоязычных авторов урок простой: ваш контент имеет рыночную стоимость, и крупнейшие ИИ-компании это понимают лучше, чем кто-либо. Не обесценивайте свои тексты сами, пока рынок только начинает признавать их ценность.

Оговорка: цитаты из документов приводятся без исходного контекста, полные материалы засекречены. Итоговое решение суда может оказаться любым.

Частые вопросы

Значит ли это, что OpenAI и Microsoft уже проиграли суд?

Нет. Суд ещё не вынес решения по существу. Рассекреченные документы, это часть процесса раскрытия доказательств. Они усиливают позицию NYT, но итог будет зависеть от того, как суд оценит все аргументы, включая доктрину fair use.

Могу ли я как автор из России подать аналогичный иск?

Теоретически, да, если докажете, что ваш контент использован без разрешения. Практически, в российских судах таких прецедентов пока нет, и доказать факт попадания конкретного текста в обучающий набор крайне сложно. Но само дело NYT формирует правовую базу, на которую можно будет ссылаться.

Как узнать, попал ли мой контент в обучающие данные?

Прямого инструмента нет. Косвенный способ: проверить наличие вашего домена в Common Crawl и попросить модель воспроизвести фрагменты вашего текста. Если она выдаёт узнаваемые куски, ваш контент с высокой вероятностью был в обучающей выборке.

Дело NYT против OpenAI и Microsoft, это не абстрактный спор корпораций, а проверка на прочность всей модели, при которой чужой труд берётся бесплатно, а продаётся дорого. Внутренние документы показали, что сами создатели технологии это понимали с самого начала.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Риски искусственного интеллекта: 51% исследователей допускают катастрофу, а инсайдеры уходят из лабораторий

Компания Anthropic сообщает, что к маю 2026 года Claude написал более 80% нового кода в её основной кодовой базе, а команда из девяти ИИ-агентов за пять дней и…

6 мин
ai

Нейросеть для сжатия текста теряет оговорки и цифры: как проверять в два прохода

Почему это важно Нейросети сокращают текст быстро, но вместе с лишними словами выбрасывают условия, оговорки и причинно-следственные связи, а читатель получает…

6 мин
Claude Code Projects запускает до 200 параллельных потоков: один диалог заменяет целую команду
ai

Claude Code Projects запускает до 200 параллельных потоков: один диалог заменяет целую команду

Anthropic полностью переработала функцию Projects в Claude Code: теперь это не папка с файлами, а единый разговор, который сам разделяет задачу на параллельные…

5 мин