Amazon скупает редкие книги для обучения нейросети на своих данных и уничтожает их: журналисты доказали
Amazon уже год скупает редкие книги оптом, сканирует их для обучения нейросети на своих данных, а затем уничтожает, и журналисты впервые доказали это с помощью трекера, спрятанного внутри книги.

Впервые документально подтверждено, что крупная технологическая компания целенаправленно скупает и физически уничтожает редкие книги ради обучающих данных (training data) для своих моделей ИИ: это превращает споры об авторских правах из теории в доказанную практику.
Издание 404 Media опубликовало расследование, в котором продавец книг по договорённости с журналистами вложил AirTag (трекер Apple для отслеживания вещей) в редкую книгу из оптового заказа. Трекер привёл на объект Amazon в Лас-Вегасе, где, по данным 404 Media, команда вырывала страницы из переплётов и сканировала их. Amazon не подтвердила и не опровергла использование книг для обучения ИИ, ограничившись общим заявлением о «развитии продуктов и сервисов».
| Что | Когда | Кто | Цена |
|---|---|---|---|
| Расследование о скупке и уничтожении книг для ИИ | Опубликовано в июне 2025 года изданием 404 Media | Amazon (объект в Лас-Вегасе) | Не раскрыта |
Как журналисты доказали скупку?
- Продавцы книг около года подозревали, что ИИ-компании массово заказывают редкие издания, но доказательств не было.
- По данным 404 Media, один продавец согласился спрятать AirTag в книгу из оптовой партии.
- Трекер привёл журналистов к складу Amazon в Лас-Вегасе. На двери склада, по описанию 404 Media, был логотип подразделения VGT3 с изображением тираннозавра, пожирающего книгу.
- Команда на объекте, по данным издания, занималась тем, что вырывала книги из переплётов и сканировала страницы.
Почему Amazon нужны именно редкие книги?
Amazon разрабатывает собственные передовые модели ИИ. Для конкуренции с Google, OpenAI и Anthropic нужен огромный объём уникальных обучающих данных. Тексты из редких книг, которые сложно найти в открытом доступе, дают преимущество при обучении нейросети на своих данных, потому что конкуренты такими данными, скорее всего, не располагают.
При этом Anthropic и xAI публично заявляли, что не используют редкие и антикварные книги для обучения своих моделей. Amazon же отказалась прямо ответить на вопрос, связаны ли закупки с обучением ИИ.
Что сказала Amazon?
Компания предоставила одинаковый комментарий и 404 Media, и изданию Ars Technica:
«Amazon приобретает книги через коммерческие каналы, чтобы помочь разрабатывать и улучшать продукты и сервисы, которыми пользуются наши клиенты.» : Официальное заявление Amazon
Слово «обучение ИИ» в заявлении не упоминается. Формулировка намеренно размытая: «продукты и сервисы» может означать что угодно, от Alexa до внутренних инструментов.
Как это касается авторов и издателей в России?
Российского аналога этой ситуации пока нет в публичном поле, но параллель прямая. Крупные российские модели, такие как YandexGPT и GigaChat от Сбера, тоже нуждаются в обучающих данных на русском языке.
- Авторам Дзена и копирайтерам. Это документальное подтверждение того, что тексты имеют прямую ценность для ИИ-компаний. Если ваш контент уникален, он потенциально интересен для обучения моделей. Следите за условиями площадок, на которых публикуете тексты, и за тем, разрешают ли они использование контента для дообучения (fine-tuning, обучение модели на конкретных примерах под узкую задачу).
- Издателям и правообладателям. Кейс Amazon даёт аргумент для обсуждения лицензирования обучающих данных. В России дискуссия о допустимости использования текстов для обучения нейросетей идёт, но пока без громких судебных дел.
- Предпринимателям. Если вы создаёте базы знаний или корпоративные модели, вопрос легальности обучающих данных касается вас напрямую. Убедитесь, что источники данных лицензированы.
На мой взгляд, самое примечательное здесь не сам факт скупки, а логотип с динозавром, пожирающим книгу. Это показывает, что внутри Amazon команда не воспринимала процесс как что-то проблемное. Для российских авторов это конкретный пример, который можно приводить в дискуссиях об обучении нейросети на своих данных: крупные игроки готовы физически уничтожать источники, лишь бы получить уникальный текст. Я бы рекомендовал прямо сейчас проверить пользовательские соглашения площадок, где вы публикуетесь, на предмет пунктов об использовании контента для ИИ. Оговорка: расследование провело одно издание на основе одного трекера, Amazon не подтвердила связь с обучением моделей, поэтому выводы пока предварительные.
Частые вопросы
Amazon признала, что уничтожает книги для обучения ИИ?
Нет. Компания дала общий комментарий о «развитии продуктов и сервисов» и не упомянула обучение ИИ. Связь со сканированием для моделей установлена журналистами 404 Media на основании трекера и описания объекта.
Другие ИИ-компании тоже скупают редкие книги?
По данным 404 Media, Anthropic и xAI публично заявляли, что не используют редкие и антикварные книги для обучения. О практиках Google и OpenAI в этом контексте источник не сообщает.
Как это влияет на авторов в России?
Напрямую пока никак: расследование касается Amazon и американского рынка. Но оно создаёт прецедент и аргумент для дискуссии о защите русскоязычного контента при обучении нейросетей, включая YandexGPT и GigaChat.
Если вы автор и создаёте уникальные тексты, самый разумный шаг сейчас: перечитать условия площадки и понять, кому вы передаёте права на свой контент и разрешаете ли его использование для обучения моделей.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Groq AI привлекла $350 млн, но потеряла половину оценки: бывший конкурент Nvidia стал её клиентом
Groq AI привлекает 350 млн долларов, но теперь работает на чипах Nvidia, а не против них: бывший конкурент стал клиентом, и это история про ловушку зависимости…

Nvidia инвестирует в дата центры SoftBank
Nvidia второго июня объявила, что вложит 1,5 миллиарда долларов в SB Energy, компанию по строительству дата-центров, связанную с SoftBank и OpenAI, и станет…

AI стартапы закрываются: основатель Relay не обыграл Zapier и вернулся в Google
Стартап Relay, выросший из идеи стать «новым Zapier», 14 сентября закроет доступ для платных пользователей, а его основатель Джейкоб Бэнк возвращается в Google…
Комментарии