Amazon уничтожает редкие книги после сканирования для обучения своей нейросети — это подтвердил скрытый AirTag, который букинисты подложили в партию антикварных изданий и отследили до склада VGT3 в Лас-Вегасе. Именно там команда Amazon вырывает страницы из переплётов, сканирует текст и отправляет остатки в утиль. Букинисты подозревали неладное больше года, но доказать массовую скупку и уничтожение книг ради тренировочных данных удалось только сейчас — благодаря расследованию 404 Media.

Amazon AI этика: как раскрыли схему

Букселлер согласился спрятать трекер в редком издании, которое ушло крупным лотом. AirTag привёл журналистов прямо к воротам склада VGT3 — и на двери там красуется логотип: тираннозавр, готовый сожрать книгу. Символично и, честно говоря, жутковато для компании, которую уличают в массовом уничтожении культурного наследия. На официальный запрос Amazon ответила обтекаемо: закупает книги «через коммерческие каналы для развития продуктов и сервисов». Про обучение ИИ — ни слова, хотя именно это и происходит.

Нейросети уничтожают книги: почему редкие издания на вес золота

Гонка за фронтир-моделями требует огромных объёмов уникальных текстов, а конкуренты вроде Google, OpenAI и Anthropic жёстко охраняют свои датасеты. Обычный интернет-текст уже во многом выкачан, поэтому редкие и антикварные книги — источник действительно нового материала. Показательно, что Anthropic и xAI публично заявили: они не тренируются на редких книгах. Amazon же, судя по обсуждениям сотрудников VGT3 на форумах, весной этого года почти исчерпала запасы книг для сканирования — склад чуть не встал из-за нехватки сырья. Но работа продолжилась, а закупки возобновились.

ИИ-чат MyKreaTool — попробовать ChatGPT, Claude и Gemini в одном окне. Прямо на MyKreaTool.Открыть инструмент →

Скандал Amazon книги: охота за ISBN

Ещё одна деталь усиливает подозрения: работников склада учили в первую очередь сканировать штрихкоды и ISBN. Букселлеры давно предполагали, что ИИ-компании методично собирают книги именно по ISBN, чтобы обеспечить максимум уникальных текстов в датасете и не дублировать уже отсканированное. Расследование 404 Media эту теорию, по сути, подтвердило.

Цифровое наследие ИИ: кому это должно быть важно

Для читателей @aigoby здесь два практических вывода. Во-первых, это подсказка о том, куда движется рынок данных для ИИ: уникальный, редкий, нигде не индексированный контент становится валютой не менее ценной, чем вычислительные мощности. Если вы работаете с текстами, архивами или нишевыми базами знаний — это актив, а не просто данные. Во-вторых, скандал — это удар по репутации Amazon и повод внимательнее выбирать, чьи ИИ-инструменты использовать в работе: инвестор Майкл Бьюри уже назвал уничтожение книг «злом в чистом виде», а вопрос защиты культурного наследия при обучении моделей явно не в приоритете у корпорации, если он идёт вразрез с гонкой за качеством нейросети.