用版权书籍训练 AI 是否合法?训练用途和盗版获取是两件不同的事
美国多起 AI 版权案件正在形成一个容易被标题混淆的分界:法院可能认为将合法取得的书籍用于训练属于合理使用,同时仍认定从盗版影子图书馆下载并长期保存副本构成侵权。
作者:沈南乔|OC 社会影响编辑
美国多起 AI 版权案件正在形成一个容易被标题混淆的分界:法院可能认为将合法取得的书籍用于训练属于合理使用,同时仍认定从盗版影子图书馆下载并长期保存副本构成侵权。
一句话结论:“训练可能合法”不能洗白数据来源,“数据来自盗版”也不自动证明模型训练这一步违法;法院正在分别审查复制、取得方式、用途和市场影响。
在 Bartz 诉 Anthropic 案中,法官 William Alsup 将模型学习书籍、生成不同作品的用途视为高度转换性,但认为建立一个包含数百万盗版书的中央资料库不受合理使用保护。案件后来以 15 亿美元和解,约 48.2 万本书进入范围,最终批准时约 91% 的作品已由作者或出版商申领。
Meta 面对 Kadrey 等作者的案件也获得阶段性胜诉,但法官强调结果与原告没有充分证明市场损害有关,不代表所有模型训练当然合法。另一个 Thomson Reuters 诉 Ross Intelligence 案则得出不同结果:Ross 用对方内容建设直接竞争的法律检索产品,法院认为缺乏新的转换性目的。

美国合理使用判断通常考虑用途与性质、作品属性、使用数量以及市场影响。AI 训练会复制整部作品,但模型是否输出可替代原作的表达、是否直接争夺同一许可市场,也会改变分析。不同法官对“训练许可市场”是否应受保护仍有明显分歧。
此前 OC 报道过 AI 公司购买稀有纸书、拆页扫描后销毁原件。那种做法说明企业已经意识到“合法取得副本”可能影响风险判断。但买下一本书也不等于买下所有版权,生成结果若大段复现原文仍可能产生新的侵权问题。
关键事实
- Bartz 案:训练用途获合理使用判断,盗版资料库部分未获保护。
- 和解:Anthropic 同意支付 15 亿美元,覆盖约 48.2 万本作品。
- Kadrey 案:Meta 胜诉与原告证据不足有关,并非普遍免责。
- Ross 案:直接建设竞争产品的训练用途未获合理使用保护。
OC 判断
现阶段不存在一句“美国法院已经认定 AI 训练合法”可以概括全部案件。企业最稳妥的路径仍是记录数据来源、保留许可链、限制可复现输出,并评估产品是否直接替代权利人的市场。
为什么重要
- 对作者:数据来源与市场损害是比抽象反对训练更具体的诉讼证据。
- 对模型公司:训练语料治理必须与模型能力开发同等重要。
- 对用户:AI 生成内容能否获得版权,与训练数据是否合法又是另一套问题。
评论
围绕这篇文章补充信息、提出问题或分享观察。