司法部在一场具有决定性意义的 AI 版权之争中明确站队
美国司法部已介入人工智能领域最具影响力的法律战之一,并采取了可能在未来多年影响法院如何看待模型训练的立场。在一份与涉及《纽约时报》及其他权利人的合并诉讼相关的文件中,司法部主张,使用受版权保护的文本训练大语言模型可以构成合理使用。
这一介入意义重大,因为此案已成为出版界与 AI 公司之间更广泛冲突的风向标。《纽约时报》于 2023 年底在曼哈顿联邦法院起诉 OpenAI 和 Microsoft,指控其数百万篇文章在未经许可的情况下被用于训练包括 GPT-4 在内的系统,并用于构建与该报作为信息来源相竞争的产品。根据所提供的来源文本,这家报纸已寻求数十亿美元赔偿,并要求销毁基于其作品训练的模型。
司法部的论点并不是说版权法与 AI 无关。相反,它提出了一个更窄但极其重要的区分:训练过程中发生的复制,与模型最终向用户生成的内容并不相同。在该部门看来,这种区分是合理使用分析的核心。
为什么“训练与输出”的区分如此重要
所提供的来源文本称,司法部认为,训练过程中可能会复制整部作品,但这些作品并不会在该过程中被公开提供。它还指出,模型输出“往往如果不是总是”与原始材料缺乏实质性相似。这触及了 AI 版权争议中最具争议的问题之一:训练时对源材料的使用,究竟应被视为一种内部分析过程,还是应被视为一种直接替代原作品的商业行为。
司法部的观点更支持前一种框架。如果法院接受这一逻辑,AI 开发者将获得更强的法律依据,主张在受版权保护的语料库上训练属于变革性使用,尤其是在最终系统并未以实质相似的方式再现受保护表达时。如果法院不接受,开发者可能面临严得多的许可义务,甚至可能遭遇重大的运营限制。
司法部还反驳了其所称过于宽泛的市场损害理论。根据来源文本,它认为不应简单地将训练和输出合并为同一种用途。这一点很重要,因为版权争议往往取决于被质疑的行为究竟只是从作品中学习,还是实际取代了该作品的市场。司法部的立场表明,原告不能仅凭其内容被纳入训练数据,就自动证明存在损害。
一则指向人类创造力的法律类比
如来源文本所概述,这份文件中较为引人注目的一点,是其援引了作家 Joan Didion 的类比。司法部提到作者通过抄写欣赏的散文来学习写作技艺这一常见做法,认为法律应当承认学习已有作品与非法再版之间的区别。该文件据称还暗示,若采用更宽泛的反训练理论,甚至这种人类学习过程在学习者之后创作出新作品时,也可能被视为侵权。
这一类比旨在传达更广泛的政策观点。版权法旨在保护原创表达,但它也存在于一个依赖学习、参考和影响的体系之中。司法部似乎在主张,仅就文本而言,对模型进行训练更接近分析行为,而非为公开传播而进行的复制。法官是否会觉得这一比较有说服力是另一回事,但它为 AI 公司提供了一种超越技术细节、触及创造力基本原则的叙事。
这份文件对出版商、AI 公司和市场意味着什么
对于出版商和其他权利人来说,这份司法部文件对许多人视为捍卫其档案控制权关键的一案而言,是一个挫折。《纽约时报》及其他原告一直认为,生成式 AI 系统从大量专业创作作品中获取价值,却没有为此付费。他们还主张,AI 产品会与原始来源在关注度、订阅和广告方面形成竞争。
对于 AI 公司而言,司法部的立场提供的不只是口头支持。它还代表美国政府的一项正式表述,即模型训练能够产生创造和社会价值,而仅因训练本身而施加责任,可能会抑制版权法本应鼓励的创新。这一表述很可能会在未来的案件、谈判和政策辩论中被广泛引用,甚至超出本案本身。
来源文本还指出,此案被普遍视为检验法院将如何处理 AI 训练的里程碑式案例。这一说法并不过分。在这一背景下,如果法院对合理使用作出更狭窄的解释,可能会改变前沿模型开发的经济结构,尤其是那些依赖极其庞大且多样化文本数据集的公司。如果法院确认训练享有较大空间,则可能巩固当前的开发模式,同时把未来争议更多转向输出内容、许可协议和产品设计选择。
更大的问题尚未定论
即便司法部如今支持合理使用理论,法律图景仍然未定。来源文本本身也指出,其他方并不同意。这种分歧反映出一个基本事实:AI 版权法仍是在诉讼中实时形成,而非建立在成熟稳定的先例体系之上。法院仍需判断,实质性相似、变换性使用和市场替代等传统原则,如何适用于那些并非简单存储和重放内容,而是从海量数据集中学习统计模式的系统。
这份文件之所以重要,也有一个现实层面的原因,因为它可能影响企业、出版商和立法者对许可的处理方式。如果训练在法律上显得更安全,AI 公司可能会减少以强制性方式获取大规模文本档案许可的压力。如果出版商认为法律风向不利于自己,他们可能会更集中地提出与具体输出、品牌混淆,或与 AI 生成且类似新闻编辑室产品的摘要所造成竞争损害有关的主张。
2026 年 9 月 2 日发生的变化,并不是最终法律答案,而是一个主要联邦机构在这场争论中明确站到了其中一边。司法部现在已明确表示,在其看来,使用受版权保护的文本训练大语言模型可以落入合理使用范围。在这场将帮助定义 AI 系统与其所学习的书面记录之间关系的争议中,这是一项重要进展。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com


