Игорь Градов
Игорь Градов
4 мин
ai

Amazon скупает редкие книги для обучения нейросети на своих данных и уничтожает их: журналисты доказали

Amazon уже год скупает редкие книги оптом, сканирует их для обучения нейросети на своих данных, а затем уничтожает, и журналисты впервые доказали это с помощью трекера, спрятанного внутри книги.

Amazon скупает редкие книги для обучения нейросети на своих данных и уничтожает их: журналисты доказали
Почему это важно

Впервые документально подтверждено, что крупная технологическая компания целенаправленно скупает и физически уничтожает редкие книги ради обучающих данных (training data) для своих моделей ИИ: это превращает споры об авторских правах из теории в доказанную практику.

Издание 404 Media опубликовало расследование, в котором продавец книг по договорённости с журналистами вложил AirTag (трекер Apple для отслеживания вещей) в редкую книгу из оптового заказа. Трекер привёл на объект Amazon в Лас-Вегасе, где, по данным 404 Media, команда вырывала страницы из переплётов и сканировала их. Amazon не подтвердила и не опровергла использование книг для обучения ИИ, ограничившись общим заявлением о «развитии продуктов и сервисов».

Что Когда Кто Цена
Расследование о скупке и уничтожении книг для ИИ Опубликовано в июне 2025 года изданием 404 Media Amazon (объект в Лас-Вегасе) Не раскрыта

Как журналисты доказали скупку?

  • Продавцы книг около года подозревали, что ИИ-компании массово заказывают редкие издания, но доказательств не было.
  • По данным 404 Media, один продавец согласился спрятать AirTag в книгу из оптовой партии.
  • Трекер привёл журналистов к складу Amazon в Лас-Вегасе. На двери склада, по описанию 404 Media, был логотип подразделения VGT3 с изображением тираннозавра, пожирающего книгу.
  • Команда на объекте, по данным издания, занималась тем, что вырывала книги из переплётов и сканировала страницы.

Почему Amazon нужны именно редкие книги?

Amazon разрабатывает собственные передовые модели ИИ. Для конкуренции с Google, OpenAI и Anthropic нужен огромный объём уникальных обучающих данных. Тексты из редких книг, которые сложно найти в открытом доступе, дают преимущество при обучении нейросети на своих данных, потому что конкуренты такими данными, скорее всего, не располагают.

При этом Anthropic и xAI публично заявляли, что не используют редкие и антикварные книги для обучения своих моделей. Amazon же отказалась прямо ответить на вопрос, связаны ли закупки с обучением ИИ.

Что сказала Amazon?

Компания предоставила одинаковый комментарий и 404 Media, и изданию Ars Technica:

«Amazon приобретает книги через коммерческие каналы, чтобы помочь разрабатывать и улучшать продукты и сервисы, которыми пользуются наши клиенты.» : Официальное заявление Amazon

Слово «обучение ИИ» в заявлении не упоминается. Формулировка намеренно размытая: «продукты и сервисы» может означать что угодно, от Alexa до внутренних инструментов.

Как это касается авторов и издателей в России?

Российского аналога этой ситуации пока нет в публичном поле, но параллель прямая. Крупные российские модели, такие как YandexGPT и GigaChat от Сбера, тоже нуждаются в обучающих данных на русском языке.

  • Авторам Дзена и копирайтерам. Это документальное подтверждение того, что тексты имеют прямую ценность для ИИ-компаний. Если ваш контент уникален, он потенциально интересен для обучения моделей. Следите за условиями площадок, на которых публикуете тексты, и за тем, разрешают ли они использование контента для дообучения (fine-tuning, обучение модели на конкретных примерах под узкую задачу).
  • Издателям и правообладателям. Кейс Amazon даёт аргумент для обсуждения лицензирования обучающих данных. В России дискуссия о допустимости использования текстов для обучения нейросетей идёт, но пока без громких судебных дел.
  • Предпринимателям. Если вы создаёте базы знаний или корпоративные модели, вопрос легальности обучающих данных касается вас напрямую. Убедитесь, что источники данных лицензированы.
Мнение редакции dzen.guru

На мой взгляд, самое примечательное здесь не сам факт скупки, а логотип с динозавром, пожирающим книгу. Это показывает, что внутри Amazon команда не воспринимала процесс как что-то проблемное. Для российских авторов это конкретный пример, который можно приводить в дискуссиях об обучении нейросети на своих данных: крупные игроки готовы физически уничтожать источники, лишь бы получить уникальный текст. Я бы рекомендовал прямо сейчас проверить пользовательские соглашения площадок, где вы публикуетесь, на предмет пунктов об использовании контента для ИИ. Оговорка: расследование провело одно издание на основе одного трекера, Amazon не подтвердила связь с обучением моделей, поэтому выводы пока предварительные.

Частые вопросы

Amazon признала, что уничтожает книги для обучения ИИ?

Нет. Компания дала общий комментарий о «развитии продуктов и сервисов» и не упомянула обучение ИИ. Связь со сканированием для моделей установлена журналистами 404 Media на основании трекера и описания объекта.

Другие ИИ-компании тоже скупают редкие книги?

По данным 404 Media, Anthropic и xAI публично заявляли, что не используют редкие и антикварные книги для обучения. О практиках Google и OpenAI в этом контексте источник не сообщает.

Как это влияет на авторов в России?

Напрямую пока никак: расследование касается Amazon и американского рынка. Но оно создаёт прецедент и аргумент для дискуссии о защите русскоязычного контента при обучении нейросетей, включая YandexGPT и GigaChat.

Если вы автор и создаёте уникальные тексты, самый разумный шаг сейчас: перечитать условия площадки и понять, кому вы передаёте права на свой контент и разрешаете ли его использование для обучения моделей.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Groq AI привлекла $350 млн, но потеряла половину оценки: бывший конкурент Nvidia стал её клиентом
ai

Groq AI привлекла $350 млн, но потеряла половину оценки: бывший конкурент Nvidia стал её клиентом

Groq AI привлекает 350 млн долларов, но теперь работает на чипах Nvidia, а не против них: бывший конкурент стал клиентом, и это история про ловушку зависимости…

4 мин
Nvidia инвестирует в дата центры SoftBank
ai

Nvidia инвестирует в дата центры SoftBank

Nvidia второго июня объявила, что вложит 1,5 миллиарда долларов в SB Energy, компанию по строительству дата-центров, связанную с SoftBank и OpenAI, и станет…

4 мин
AI стартапы закрываются: основатель Relay не обыграл Zapier и вернулся в Google
ai

AI стартапы закрываются: основатель Relay не обыграл Zapier и вернулся в Google

Стартап Relay, выросший из идеи стать «новым Zapier», 14 сентября закроет доступ для платных пользователей, а его основатель Джейкоб Бэнк возвращается в Google…

4 мин