亚马逊买走稀有纸书训练 AI,还把原书销毁:数据需求开始吃掉原件
作者:沈南乔|OC 社会影响编辑
作者:沈南乔|OC 社会影响编辑
404 Media 把追踪器藏进一批卖给匿名买家的旧书,最终发现货物进入亚马逊位于拉斯维加斯附近的设施。该媒体采访的员工称,书籍会被切掉书脊、逐页扫描,随后销毁。Ars Technica 随后核对并扩展了这项调查。
一句话结论:此前只能确认 AI 公司在批量购买纸书,现在新的调查把链条推进到扫描与销毁,也把训练数据争议从版权扩展到原件保存。
OC 此前已经报道,二手书商收到大量不按主题、只按 ISBN 和语言筛选的订单。当时最合理的判断是,买家更在意“文本是否独特”,而不是书本身的收藏价值。这次追踪提供了新增事实:至少这一批书进入了亚马逊设施,员工描述的处理方式是破坏性扫描。
亚马逊对媒体确认购书是为了改进产品和服务,但没有详细回答销毁规模、选择标准和设施数量。因而目前可以确认的是具体货运路线、设施和员工描述,不能据此断言亚马逊销毁了所有买到的旧书,也不能把每一册都称为珍本。

争议的难点正在这里。大量旧书确实可能没有高昂市场价格,拆解扫描也可能是建立可搜索数字档案的最快方式;但“市场上便宜”不等于“可以重新获得”。小语种、地方出版物、绝版技术手册和私人印刷品,一旦原件被集中收走并销毁,公共图书馆和研究者可能永远失去接触它们的机会。
AI 公司还拥有另一层优势:实体书变成私有训练数据后,外界既看不到目录,也无法判断版权状态、版本差异和保存去向。数据保密保护了模型资产,却把文化保存成本留给了一个并不知道哪些书正在消失的社会。
关键事实
- 新证据:404 Media 在一批书中放置追踪器,货物进入亚马逊设施
- 处理方式:受访员工称书籍被切除书脊、扫描并销毁
- 亚马逊回应:确认购书用于改进产品和服务,未完整说明销毁规模
- 与旧稿关系:这是对“AI 公司批量购买二手书”的实质跟进
OC 判断
训练数据的价值不应该自动高于原件的保存价值。至少在批量破坏性扫描之前,AI 公司应公开选择标准、保存方案和可供图书馆接收的退出渠道。数据保密不是销毁文化材料而无需说明的理由。
为什么重要
- 对读者和作者:作品可能以不可见方式进入模型训练,同时原始载体消失。
- 对图书馆:低市场价但不可替代的长尾出版物需要新的抢救机制。
- 对 AI 公司:训练数据治理开始涉及实物来源、保存责任和可审计目录。
评论
围绕这篇文章补充信息、提出问题或分享观察。