Anthropic скупает и уничтожает книги: обучение нейросети на своих данных оказалось легальным
Anthropic и другие крупные ИИ-лаборатории массово скупают бумажные книги, сканируют их для обучения нейросети на своих данных, а после оцифровки уничтожают физические экземпляры, и это оказывается легально по американскому копирайт-праву.
Суд фактически подтвердил: если компания купила книгу и уничтожила оригинал после сканирования, копия считается законной заменой, а не пиратством. Для авторов и издателей это означает, что их тексты попадают в обучающие данные (training data, массивы текстов, на которых тренируют нейросеть) без отдельного лицензирования.
Скандал вспыхнул после того, как в англоязычном сегменте сети снова всплыли подробности практики: ИИ-компании заказывают миллионы книг, промышленным способом отрезают корешки для ускорения сканирования, оцифровывают содержимое и отправляют бумажные остатки на утилизацию. Anthropic уже получала штраф в 1,5 млрд долларов за нарушение авторских прав при использовании книг. Источник при этом фиксирует: практика не прекратилась, она лишь адаптировалась к судебным решениям.
Зачем компании уничтожают книги после сканирования?
Логика простая и циничная. Всё, что доступно в открытом интернете, ИИ-лаборатории уже использовали многократно. Качественных текстов в сети не так много: значительная часть онлайн-контента не подходит для повышения уровня модели. Бумажные книги выигрывают тем, что их писал живой автор, а затем проверял редактор.
Но просто купить и отсканировать книгу означает создать копию, а это потенциальное нарушение копирайта. Судья в одном из разбирательств с Anthropic разъяснил: если оригинал уничтожен, юридически происходит не копирование, а трансформация одного экземпляра из физической формы в цифровую. Нет второго экземпляра, нет и нарушения.
Как выглядит процесс обучения нейросети на своих данных у Anthropic?
Исходя из описания процесса, цепочка такова:
- Закупка. Компания массово заказывает книги, включая редкие издания с ограниченным тиражом.
- Подготовка. Корешки книг срезают промышленным способом, чтобы страницы проходили через поточный сканер.
- Оцифровка. Текст сканируется и конвертируется в данные, пригодные для дообучения (fine-tuning, обучение модели на новых примерах под конкретную задачу) или базового обучения модели.
- Уничтожение. Физический экземпляр утилизируется, что по американскому праву делает цифровую копию легальной заменой, а не пиратской копией.
Что понадобится
Если вы автор или издатель и хотите понять, затрагивает ли вас эта практика:
- Проверить, продаются ли ваши книги через открытые маркетплейсы (Amazon, AbeBooks и аналоги), откуда ИИ-компании делают массовые закупки
- Изучить лицензионные условия ваших договоров с издательством: передавали ли вы право на перепродажу без ограничений
- Отслеживать судебные прецеденты: решения американских судов формируют практику, которую другие юрисдикции могут перенять или отвергнуть
Пошаговая инструкция: как проверить, используются ли ваши тексты
- Откройте модель Claude (разработка Anthropic) или ChatGPT и задайте прямой вопрос о содержании вашей книги. Если модель воспроизводит фрагменты или пересказывает структуру, ваш текст с высокой вероятностью попал в обучающие данные.
Перескажи содержание книги [название] автора [имя].
Процитируй фрагмент из главы 3 книги [название].
- Зафиксируйте ответ модели: сделайте скриншот с датой.
- Проверьте, есть ли ваша книга в известных датасетах. Сервис «Have I Been Trained» позволяет искать по части открытых обучающих наборов.
- Если нашли свой текст, обратитесь к юристу по интеллектуальной собственности в вашей юрисдикции. Американский прецедент не действует автоматически в РФ.
Автор нишевой книги по маркетингу (тираж 2 000 экземпляров) вводит в Claude промпт (запрос к нейросети): «Перескажи ключевые идеи книги [название]». Модель выдаёт точный пересказ пяти из восьми глав, включая авторские примеры и метафоры. Это означает, что текст попал в обучающие данные. При этом автор не давал согласия и не получил компенсации.
Переносить американскую логику на РФ. Российское копирайт-право не содержит нормы, по которой уничтожение оригинала легализует цифровую копию. В РФ обязательны архивные экземпляры (закон об обязательном экземпляре документов), поэтому модель «купил, отсканировал, уничтожил» юридически здесь не работает.
Думать, что редкость книги защищает. Как раз редкие издания привлекательнее для ИИ-компаний: это уникальные данные, которых нет в интернете.
Игнорировать масштаб. Речь идёт о миллионах экземпляров, а не о единичных случаях. Если ваша книга продаётся на открытом рынке, она потенциально в зоне риска.
Что делать прямо сейчас, по ролям
Авторам Дзена и копирайтерам. Ваши тексты на платформе индексируются поисковиками и парсерами. Обучение нейросети на своих данных, которое ведут крупные лаборатории, затрагивает и веб-контент. Проверьте robots.txt вашего сайта: директива для ботов ИИ-компаний (GPTBot, ClaudeBot, anthropic-ai) позволяет хотя бы формально ограничить сбор.
Издателям и правообладателям. Включайте в договоры с дистрибьюторами запрет на перепродажу для целей машинного обучения. Это не гарантия, но создаёт юридическое основание для претензий.
Предпринимателям в РФ. В России аналогичных массовых закупок книг для обучения ИИ публично не зафиксировано. Но YandexGPT и GigaChat тоже обучаются на текстах. Разница в том, что российское законодательство строже в части архивных копий и не допускает уничтожения оригинала как основания для легализации копии.
История с Anthropic обнажает разрыв между юридической нормой и здравым смыслом. По букве американского закона компания действует легально: один экземпляр превращается в другую форму. По существу, автор лишается контроля над своим текстом без компенсации и без согласия.
Для тех, кто работает с контентом в РФ, я вижу два практических вывода. Первый: любой текст, доступный для покупки или скачивания, рано или поздно попадёт в обучающие данные какой-то модели, это вопрос времени, а не принципа. Второй: пока нет международного регулирования, единственная реальная защита это договорные ограничения и мониторинг.
Штраф в 1,5 млрд долларов Anthropic не остановил. Значит, экономика обучения перевешивает штрафы. Это честный сигнал для каждого, кто создаёт тексты профессионально.
Ситуация с массовой скупкой и уничтожением книг ради обучения нейросетей ставит конкретный вопрос перед каждым автором: не «украдут ли мой текст», а «уже украли или ещё нет». Проверьте сегодня, ответ может неприятно удивить.
Проверьте, как ИИ работает с вашим контентом
Генератор промптов dzen.guru поможет составить точные запросы для проверки, попали ли ваши тексты в обучающие данные
Попробовать генератор
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Apple привяжет Siri ИИ к подписке iCloud+: базовый доступ бесплатно, мощности за деньги
Компания Apple на последнем отчёттном звонке Тима Кука в роли генерального директора объявила, что обновлённая Siri с искусственным интеллектом может получить…

Индексация сайта в Яндексе за 1–2 дня: четыре инструмента для попадания в ответы Алисы AI
Яндекс не покажет вашу страницу ни в поиске, ни в ответах Алисы AI, пока робот её не обойдёт и не добавит в индекс, и этот процесс можно ускорить с нескольких…
Google Earth убрал deepfake-нейросеть за сутки: фейки обманули даже детекторы ИИ
Google Earth второго июня запустил инструмент, который позволял редактировать спутниковые снимки текстовыми промптами, а уже на следующий день спешно убрал…
Комментарии