二手书商遭遇无主题批量订单:AI 公司为什么又需要购买纸书
作者:陈墨|OC 产业与资本编辑
作者:陈墨|OC 产业与资本编辑
据 BBC 与 《卫报》 报道,英国和爱尔兰多家二手书商近几个月收到异常的批量订单:买家分布在美国、加拿大和欧洲,书目没有主题关联,常指定冷门版本,并愿意按高价购买。书商怀疑这些书会被用于 AI 训练,但买家身份和最终用途尚未得到确认。
一句话结论:AI 公司可能重新购买纸书,不是因为互联网没有文字,而是需要版权链更清楚、模型生成污染更少、网上从未数字化的长尾内容。
一家英国书商称,三名买家购买了数百本随机书籍,总额约 4000 英镑;另一名书商今年收到类似买家的 6000 本订单。书目从 18 世纪非洲农业工具到 1950 年代赛车手传记,甚至指定爱沙尼亚语译本和某一版月刊。随机性和机器化下单让业内联想到训练数据采购。
这种猜测有现实背景。Anthropic 此前在美国购买大量书籍,切除书脊后进行工业化扫描,内部项目被称为 Project Panama。美国法院在相关案件中认为,使用合法购买书籍训练模型具有高度转化性;Anthropic 表示,购买书籍是行业常见做法,其项目不购买并销毁珍本或古籍。

但不能据此把这批新订单直接归给 Anthropic。报道中的仓库、别名和回收公司没有公开最终客户,部分公版书本来就能免费获取,也削弱了单一解释。订单可能来自不同数据商,甚至存在与 AI 无关的用途。
纸书仍有三种数据价值。第一,出版于生成式 AI 普及前,文本受合成内容污染较少;第二,大量地方出版物和旧版从未完整上线;第三,购买实体副本在美国能形成比抓取盗版库更有利的法律记录。不过英国版权法通常仍要求为复制和训练取得权利人许可,买到纸书不自动等于买到复制权。
关键事实
- 现象:无主题、指定版本、跨境、高价的二手书批量订单增加
- 规模:受访书商报告数百至数千本不等
- 推测:书商怀疑用于扫描和 AI 训练,但没有确认最终买家
- 法律差异:购买实体书不在所有司法辖区自动赋予训练复制权
OC 判断
模型公司对高质量训练数据的需求没有因为合成数据出现而消失,反而让“人类写作、出版前审校、未被互联网复制”的内容更值钱。真正值得追踪的是买家披露、版权许可和珍本保护,而不是把每一张冷门书订单都提前写成 AI 公司的证据。
为什么重要
- 对出版业:纸质库存可能成为数据资产,但作者和出版社是否分成仍不明确。
- 对模型公司:合法购买副本能改善证据链,却不能消除不同国家的复制权风险。
- 对书商:短期收入上升伴随珍稀版本被破坏和市场库存失真的可能。
评论
围绕这篇文章补充信息、提出问题或分享观察。