Игорь Градов
Игорь Градов
5 мин
ai

Anthropic скупает и уничтожает книги: обучение нейросети на своих данных оказалось легальным

Anthropic и другие крупные ИИ-лаборатории массово скупают бумажные книги, сканируют их для обучения нейросети на своих данных, а после оцифровки уничтожают физические экземпляры, и это оказывается легально по американскому копирайт-праву.

Почему это важно

Суд фактически подтвердил: если компания купила книгу и уничтожила оригинал после сканирования, копия считается законной заменой, а не пиратством. Для авторов и издателей это означает, что их тексты попадают в обучающие данные (training data, массивы текстов, на которых тренируют нейросеть) без отдельного лицензирования.

Скандал вспыхнул после того, как в англоязычном сегменте сети снова всплыли подробности практики: ИИ-компании заказывают миллионы книг, промышленным способом отрезают корешки для ускорения сканирования, оцифровывают содержимое и отправляют бумажные остатки на утилизацию. Anthropic уже получала штраф в 1,5 млрд долларов за нарушение авторских прав при использовании книг. Источник при этом фиксирует: практика не прекратилась, она лишь адаптировалась к судебным решениям.

Зачем компании уничтожают книги после сканирования?

Логика простая и циничная. Всё, что доступно в открытом интернете, ИИ-лаборатории уже использовали многократно. Качественных текстов в сети не так много: значительная часть онлайн-контента не подходит для повышения уровня модели. Бумажные книги выигрывают тем, что их писал живой автор, а затем проверял редактор.

Но просто купить и отсканировать книгу означает создать копию, а это потенциальное нарушение копирайта. Судья в одном из разбирательств с Anthropic разъяснил: если оригинал уничтожен, юридически происходит не копирование, а трансформация одного экземпляра из физической формы в цифровую. Нет второго экземпляра, нет и нарушения.

Как выглядит процесс обучения нейросети на своих данных у Anthropic?

Исходя из описания процесса, цепочка такова:

  1. Закупка. Компания массово заказывает книги, включая редкие издания с ограниченным тиражом.
  2. Подготовка. Корешки книг срезают промышленным способом, чтобы страницы проходили через поточный сканер.
  3. Оцифровка. Текст сканируется и конвертируется в данные, пригодные для дообучения (fine-tuning, обучение модели на новых примерах под конкретную задачу) или базового обучения модели.
  4. Уничтожение. Физический экземпляр утилизируется, что по американскому праву делает цифровую копию легальной заменой, а не пиратской копией.

Что понадобится

Если вы автор или издатель и хотите понять, затрагивает ли вас эта практика:

  • Проверить, продаются ли ваши книги через открытые маркетплейсы (Amazon, AbeBooks и аналоги), откуда ИИ-компании делают массовые закупки
  • Изучить лицензионные условия ваших договоров с издательством: передавали ли вы право на перепродажу без ограничений
  • Отслеживать судебные прецеденты: решения американских судов формируют практику, которую другие юрисдикции могут перенять или отвергнуть

Пошаговая инструкция: как проверить, используются ли ваши тексты

  1. Откройте модель Claude (разработка Anthropic) или ChatGPT и задайте прямой вопрос о содержании вашей книги. Если модель воспроизводит фрагменты или пересказывает структуру, ваш текст с высокой вероятностью попал в обучающие данные.
Перескажи содержание книги [название] автора [имя].
Процитируй фрагмент из главы 3 книги [название].
  1. Зафиксируйте ответ модели: сделайте скриншот с датой.
  2. Проверьте, есть ли ваша книга в известных датасетах. Сервис «Have I Been Trained» позволяет искать по части открытых обучающих наборов.
  3. Если нашли свой текст, обратитесь к юристу по интеллектуальной собственности в вашей юрисдикции. Американский прецедент не действует автоматически в РФ.
Как это выглядит на практике

Автор нишевой книги по маркетингу (тираж 2 000 экземпляров) вводит в Claude промпт (запрос к нейросети): «Перескажи ключевые идеи книги [название]». Модель выдаёт точный пересказ пяти из восьми глав, включая авторские примеры и метафоры. Это означает, что текст попал в обучающие данные. При этом автор не давал согласия и не получил компенсации.

Частые ошибки

Переносить американскую логику на РФ. Российское копирайт-право не содержит нормы, по которой уничтожение оригинала легализует цифровую копию. В РФ обязательны архивные экземпляры (закон об обязательном экземпляре документов), поэтому модель «купил, отсканировал, уничтожил» юридически здесь не работает.

Думать, что редкость книги защищает. Как раз редкие издания привлекательнее для ИИ-компаний: это уникальные данные, которых нет в интернете.

Игнорировать масштаб. Речь идёт о миллионах экземпляров, а не о единичных случаях. Если ваша книга продаётся на открытом рынке, она потенциально в зоне риска.

Что делать прямо сейчас, по ролям

Авторам Дзена и копирайтерам. Ваши тексты на платформе индексируются поисковиками и парсерами. Обучение нейросети на своих данных, которое ведут крупные лаборатории, затрагивает и веб-контент. Проверьте robots.txt вашего сайта: директива для ботов ИИ-компаний (GPTBot, ClaudeBot, anthropic-ai) позволяет хотя бы формально ограничить сбор.

Издателям и правообладателям. Включайте в договоры с дистрибьюторами запрет на перепродажу для целей машинного обучения. Это не гарантия, но создаёт юридическое основание для претензий.

Предпринимателям в РФ. В России аналогичных массовых закупок книг для обучения ИИ публично не зафиксировано. Но YandexGPT и GigaChat тоже обучаются на текстах. Разница в том, что российское законодательство строже в части архивных копий и не допускает уничтожения оригинала как основания для легализации копии.

Мнение редакции dzen.guru

История с Anthropic обнажает разрыв между юридической нормой и здравым смыслом. По букве американского закона компания действует легально: один экземпляр превращается в другую форму. По существу, автор лишается контроля над своим текстом без компенсации и без согласия.

Для тех, кто работает с контентом в РФ, я вижу два практических вывода. Первый: любой текст, доступный для покупки или скачивания, рано или поздно попадёт в обучающие данные какой-то модели, это вопрос времени, а не принципа. Второй: пока нет международного регулирования, единственная реальная защита это договорные ограничения и мониторинг.

Штраф в 1,5 млрд долларов Anthropic не остановил. Значит, экономика обучения перевешивает штрафы. Это честный сигнал для каждого, кто создаёт тексты профессионально.

Ситуация с массовой скупкой и уничтожением книг ради обучения нейросетей ставит конкретный вопрос перед каждым автором: не «украдут ли мой текст», а «уже украли или ещё нет». Проверьте сегодня, ответ может неприятно удивить.

Проверьте, как ИИ работает с вашим контентом

Генератор промптов dzen.guru поможет составить точные запросы для проверки, попали ли ваши тексты в обучающие данные

Попробовать генератор
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Apple привяжет Siri ИИ к подписке iCloud+: базовый доступ бесплатно, мощности за деньги
ai

Apple привяжет Siri ИИ к подписке iCloud+: базовый доступ бесплатно, мощности за деньги

Компания Apple на последнем отчёттном звонке Тима Кука в роли генерального директора объявила, что обновлённая Siri с искусственным интеллектом может получить…

5 мин
Индексация сайта в Яндексе за 1–2 дня: четыре инструмента для попадания в ответы Алисы AI
ai

Индексация сайта в Яндексе за 1–2 дня: четыре инструмента для попадания в ответы Алисы AI

Яндекс не покажет вашу страницу ни в поиске, ни в ответах Алисы AI, пока робот её не обойдёт и не добавит в индекс, и этот процесс можно ускорить с нескольких…

6 мин
ai

Google Earth убрал deepfake-нейросеть за сутки: фейки обманули даже детекторы ИИ

Google Earth второго июня запустил инструмент, который позволял редактировать спутниковые снимки текстовыми промптами, а уже на следующий день спешно убрал…

5 мин