# 亚马逊买下绝版书，拆掉书脊扫描，用来训练 AI 模型

> 原标题：Amazon, which started off selling books, is destroying rare texts to train AI

- 来源：TechCrunch · AI
- 发布时间：2026-08-17T16:38:44.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51371
- 原文：https://techcrunch.com/2026/08/17/amazon-once-an-online-bookseller-is-destroying-rare-books-to-train-ai-models/

## 摘要

404 Media 在一本绝版书里塞了追踪器，最后定位到亚马逊在拉斯维加斯的 VGT3 设施。亚马逊确认会通过商业渠道买书来改进产品。这些绝版、不再印刷的书对训练大模型很有价值：它们没被传到网上，而且出版时间都在 2022 年之前，可以保证不是 AI 生成的文本，能避免模型用太多合成数据训练后出现“模型崩溃”——也就是输出质量越来越差的问题。

## 推荐理由

404 Media 的追踪器调查把一个抽象的数据获取问题变成了一个具体、有画面感的故事，而且直接关联到行业痛点——干净训练数据的稀缺性。分数维持在 78 分，因为亚马逊只确认了通过商业渠道买书，没承认销毁，故事有一半是调查方的单方叙述，信息缺口还在。

## 锐评

404 Media 做了个硬核调查：往一本绝版书里塞追踪器，最后定位到亚马逊拉斯维加斯的 VGT3 设施。亚马逊也承认了，会通过商业渠道买书来改进产品。这事听着离谱，但从训练角度看逻辑很直白——网上能爬的公开文本早被各家模型用光了，绝版书没被数字化过，出版时间又在 2022 年之前，天然保证不是 AI 生成的，能帮模型避开“用合成数据训练导致输出越来越差”的模型崩溃问题。

不过文章没披露亚马逊到底买了多少本、销毁了多少本，也没说这些书具体喂给了哪些模型。追踪器只证明书到了那个设施，后续是扫描还是人工录入、数据怎么清洗，正文都没交代。另外，Anthropic 也被提到在找这类稀缺文本，说明这不是亚马逊一家的做法。

我会先打个折：404 Media 的调查方法很聪明，但单点追踪只能证明“发生过”，推不出规模。如果想知道这事有多大，还得看有没有更多出版商或作者站出来说自己的绝版书被批量采购后消失。
