治理与合规AI 产品与平台

同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元

Bartz v. Anthropic 版权诉讼中,多位作家和版权人指控 AI 公司 Anthropic 从 LibGenPiLiMi 等盗版渠道下载数百万册图书,并在服务器上建立起供 AI 研发使用的内部研究库。2026 年 7 月 20 日,法院对此案做出最终批准判决(Final Approval Order and Judgment, Dkt. 680 (2026-07-20)),确认设立一笔 15 亿美元的非返还和解基金,以此终结这起集体诉讼。在这笔巨额基金中,法院批准的原告律师费超过了 1 亿美元。

这一和解结果让行业感到意外。在此之前,法庭已在诉讼记录中倾向于认定,大模型读取图书进行训练符合美国版权法中的合理使用(fair use)原则,因为这种计算是为了学习语言规律,并不会破坏原书的商业市场。既然核心的训练计算可能属于合理使用,为什么 Anthropic 还要同意支付 15 亿美元达成和解?

要理解这一反差,必须看清数据在技术流水线中的流转过程。从下载图书、在服务器中留存,到最终载入显存训练,同一个数字副本在不同阶段会触发不同的复制行为。法院并没有判定大模型开发流程整体合法或非法,也没有在法律上划分出不相干的合规路径与侵权路径。它只是针对流水线中的不同环节,分别评估了法律责任:一是获取和保留源文件,二是将文件载入显存进行训练。

这起案件中发生了什么,为什么这一结果令人意外?

我们可以追踪一本图书在研发系统中的生命周期。从系统下载文件存入服务器,到最后载入显存更新参数,同一个数字副本在技术上经历了多次复制动作。

法院在 2025 年 6 月 23 日做出裁决(Order on Fair Use, Dkt. 231 (2025-06-23)),评估了将图书读入显存以更新大模型参数的训练行为。法官倾向于支持 Anthropic,因为机器训练旨在提取统计规律,它不像人类读者那样去消费小说的故事情节,因而符合合理使用(fair use)原则。

但在训练发生前,这本小说的数字副本已经在 Anthropic 的服务器里存了很久。对于在公司内部长期保留盗版书籍的行为,法院拒绝在开庭审理前给予豁免,驳回了 Anthropic 关于合理使用的即决判决申请。这意味着,如果诉讼继续推进,陪审团将裁决在内部保留这些书籍是否构成侵权,以及如果侵权成立应如何赔偿。在陪审团做出裁决之前,Anthropic 支付了一笔固定基金,以此终结这项明确的历史集体诉讼风险。这笔交易的本质是:用一笔确定的支出,买断了陪审团裁定前悬而未决的历史诉讼风险。这是一次通过谈判达成的风险和解,既不是 Anthropic 承认在此问题上败诉,也不是一份通用的授权许可,更不代表法院或协议宣告该大模型是清白干净的。为了看清这一差异,我们需要顺着数据在系统内部经历的完整技术管线看起。

同一个技术管线在不同阶段为什么会面临不同的法律对待?

在技术层面,这是一条连贯的流水线。我们以一本图书的流转为例,看看它如何穿过研发系统:

一份书籍副本从取得、留存到训练:Bartz 案中不同复制用途的法律结论

第一步,系统从 LibGenPiLiMi 等公开网络渠道下载小说的数字文件。

第二步,系统将下载的文件存入本地,与其他图书汇聚成一个长期保留的内部图书仓库。诉讼案卷将这一仓库称为 central library

第三步,模型开始训练,系统从 central library 提取该书,将其载入显存计算并更新参数。

在整条流水线中,同一个文件在不同阶段的复制行为面临着不同的法律评估。

首先是载入显存的计算副本。系统为了提取统计规律而将数据读入显存,这构成了合理使用(fair use)判定的基石。

但前一环节中静态存放在硬盘上的 central library,性质完全不同。在服务器中长期保留原始格式的盗版书,没有转化性的新目的,只是单纯的复制与存储。对于这种留存行为,法院在 2025 年 6 月的裁决中指出,无法在开庭审理前直接给予合理使用豁免。

法院在庭审前不予豁免,并不等于直接判定该仓库侵权。由于案件随后达成和解,原定的陪审团审判随即取消,法庭从未对这个内部仓库的法律责任做出最终定性。但对 AI 团队来说,硬盘上的中间留存步骤确实成了整条流水线中最大的合规隐患。

15 亿美元究竟买到了什么,又没买到什么?

在集体诉讼制度下,中间阶段的合规隐患最终演变成了巨大的财务风险。这笔 15 亿美元的和解金,针对的正是这一环节积累的历史诉讼风险。

要理解这笔金额,需要了解美国版权法中特有的法定赔偿(statutory damages)制度。在这种赔偿机制下,原告不需要证明具体的实际经济损失,法院会直接按照受侵权作品的部数来裁定赔偿额。根据美国版权法(17 U.S.C. § 504(c)),每部作品的常规赔偿标准在 750 美元至 30,000 美元之间;如果认定构成故意侵权,赔偿上限可达 150,000 美元。

Bartz v. Anthropic 案中,原告于 2025 年 7 月 17 日获得集体诉讼认证(Order on Class Certification, Dkt. 244 (2025-07-17)),这让数十万名版权持有人得以组成集体向 Anthropic 共同索赔。尽管法院否决了针对 Books3 和扫描图书的集体认证,但批准了针对从 LibGenPiLiMi 渠道获取图书的集体诉讼认证。

双方最终整理出一份符合和解条件的版权作品清单,即 Works List,共包含 482,460 部作品。如果诉讼继续推进,陪审团将决定在 central library 内部仓库中保留这些书籍是否构成侵权责任,并裁定最终的赔偿金额。一旦判定侵权成立,即便陪审团仅按法定下限每部作品 750 美元裁决,总赔偿额也会超过 3.6 亿美元;如果认定构成故意侵权,上限更可能突破 720 亿美元。为了在陪审团裁决前终结这一明确的历史集体诉讼风险,Anthropic 支付了 15 亿美元设立固定基金。这笔交易的本质是:用一笔确定的支出,买断了陪审团做出裁决前悬而未决的巨额诉讼风险。这属于双方谈判达成的风险和解,既不意味着 Anthropic 承认在留存问题上败诉,也不是一份未来的通用授权许可,更不代表法庭或协议宣告该大模型本身完全清白。

在这笔 15 亿美元的非返还基金中,法院批准的原告律师费为 101,561,111 美元,其余净额分发给各版权方。截至 2026 年 4 月 16 日,清单内已有 91.3% 的作品提交了索赔申请。如果简单将 15 亿美元平摊到 482,460 部作品上,粗算得出每部作品名义上约合 3,109 美元。但必须指出,这只是包含律师费和管理成本在内的毛额,并不是常规的版权许可费,更不能作为大模型训练的未来授权定价参考。虽然法院已于 2026 年 7 月 20 日做出最终批准判决,但资金分发、责任释放以及文件销毁工作,仍需要根据和解协议规定的 Effective Date 来逐步生效与推进。

那么,支付了这笔巨额和解金,是否意味着最终训练出的模型就彻底合规了?

答案是否定的。无论是法庭裁决还是和解协议本身,都没有给模型颁发合规证书。

首先,法院对模型训练可能属于合理使用的倾向性意见,并不等于宣告最终的模型权重不构成侵权,更没有追溯性地使最初的源文件仓库合法化。同样,和解协议也没有对模型权重是否侵权做出任何判定。

其次,和解协议(Class Action Settlement Agreement)虽然写明了 Anthropic 的一项陈述,称其公开发布的商业大模型训练集未包含 LibGenPiLiMi 的数据。但这只是签约方的单方陈述与保证,并非法院调查认定的司法事实。

第三,这笔和解实质上是花钱消除特定的历史诉讼风险,并非万能免罪符。它免除的仅仅是针对 Works List 中特定作品、在特定时间段内,模型训练阶段(输入端)的复制侵权指控。至于模型输出端的侵权索赔(例如用户引导模型生成与原书高度相似的文本片段),以及和解协议生效后的未来数据使用行为,全部排除在免责范围之外。

此外,和解协议要求 Anthropic 销毁从 LibGenPiLiMi 下载的原始书籍,以及从这些渠道下载的全部本地副本(因诉讼保全义务需要保留的证据除外),但没有要求其删除或销毁已经训练好的模型权重。

15 亿美元和解覆盖范围:Works List、释放范围与明确排除事项

AI 数据系统未来应该能够证明什么?

这场诉讼的结局迫使 AI 行业重新审视数据合规。安全边界不再是法庭上的抽象辩论,它已经变成了公司在工程层面自证合规的能力。

在后和解时代,大模型团队对数据的审计无法再停留在记录数据集名称的粗放阶段。一套合格的数据管理系统,必须在工程层面能够证明以下几点:

首先是获取渠道。系统必须能够精准追溯每个文件的具体来源,确保团队随时可以识别并剥离存在渠道风险的文件。

其次是复制目的。系统必须明确区分临时的内存计算缓存与长期的静态存储副本,防止因用途混淆而留下合规隐患。

第三是留存状态。对于不需要长期保留的临时文件,系统应建立自动化清理机制,避免数据在服务器中滞留。

最后是删除与保留状态。如果版权人提出下架要求,或者法庭下达诉讼保全令,系统必须能够精准定位、隔离并销毁特定数据,同时生成难以篡改的审计日志。

对于大模型研发团队来说,数据管理系统的升级不仅是一项合规建议,更是必须落实的工程底线。未来的数据流水线不能只给出一个数据集的名称,必须拿出一条完整的证据链,把获取渠道、复制目的、留存状态和删除状态全部串联起来。

鸭哥每日手记

日更的深度AI新闻和分析