「训练是合理使用」——美国司法部把一桩版权案,打成了国家安全问题

2026-09-03 · 版权 · AI治理 · 模型训练 · 政策
美国司法部把「训练即合理使用」从一种法律主张升级为国家立场,AI 训练数据的产权问题正在从法院和立法机构手中,滑向产业政策框架。

先说结论

9 月 1 日,美国司法部在纽约南区法院 OpenAI 版权合并诉讼的案卷里,提交了一份 20 页的「利益声明」(Statement of Interest)。它要求法官接受一个结论:用版权作品训练大模型,本身就是合理使用;而让发展美国 AI 产业变难的法律规则,就「威胁国家安全」,等于给外国对手让出竞争优势。

文件的法律论证并不新,基本是把 OpenAI 等公司在法庭上讲过的辩词重述了一遍。分量在署名人:副司法部长 Woodward、民事司助理部长 Shumate。私人公司之间的版权官司,美国政府以这个层级下场,在版权诉讼里很少见。

事情是怎么发生的

《纽约时报》2023 年 12 月起诉 OpenAI 和微软,指控 ChatGPT 的训练与输出侵权。案子后来并入南区法院的合并诉讼(MDL),原告还有 Alden 旗下报纸、一批作家和 The Intercept 这样的非营利编辑室。

9 月 1 日,司法部依据 28 U.S.C. § 517——一条允许它「照看美国利益」的旧法条——递交声明,铺底是 2025 年 1 月「移除美国 AI 领导地位障碍」行政令。文件有四层主张:

第一,训练阶段的使用「转换性极强」,直接搬用 Bartz 诉 Anthropic 案的原话:transformative—spectacularly so。

第二,训练不向公众透露任何内容,只是制造拷贝教模型识别数据关系;输出偶尔复现原文属于「另案处理的异常使用」,不影响训练定性。

第三,点名反驳 Kadrey 诉 Meta 案的「间接市场稀释」思路,还用了类比:琼·狄迪恩年轻时靠手打海明威的小说学写作,按那套逻辑,她每发表一篇文章都该向海明威付钱。

第四,反向论证:若训练要付费,只有最大的科技公司付得起许可费,钱最后会变成给老牌媒体的补贴——「这不符合公众利益」。

为什么重要

合理使用在美国版权法里是个案平衡:四个因素、逐案判断。这份文件实际是要求法院接受一个接近一刀切的结论,而理由不是教义,是产业政策。

这改变了问题的性质。授权费和「国家安全」从来不在同一个语域。当政府把「模型能不能免费读你们的内容」绑定到国际竞争上,创作者手里的法律筹码就变成了政治问题——而政治问题不由法官和作者裁决。

商业后果是即时的。过去几年 OpenAI 与新闻集团、Axel Springer、美联社签了一轮内容授权,前提是授权在法律上大概率必要。训练一旦被判免费,已签协议就从法律义务变成自愿支出,授权市场的价格支撑被抽掉。

还有一个容易被略过的细节:文件一边说「是否需要重写版权原则,是留给人民和他们选出的代表的政策问题」,一边用行政权力向法院推一个立法级别的结论。右手说交给国会,左手把国会的活先干了。

站得住与站不住的地方

站得住的部分:它的法理不是凭空造的。Authors Guild 诉 Google 案确立的转换性使用框架,加上 2025 年 Bartz、Kadrey 两案里 AI 公司在训练环节的胜诉,判例确实在往「训练免费」方向走;把训练和输出分开处理也有先例,Authors Guild 案本身就区分了搜索、摘要、下载三种使用。

站不住的部分同样清楚。其一,「威胁国家安全」引用的是 GAO 2022 年一份关于政府机构采用 AI 的报告,与私人公司能否免费拿走版权内容没有直接关系,这是把产业竞争包装成法律解释。其二,「帮小媒体」与事实相反:至今的授权协议几乎都签给了大机构,小编辑室连桌子都上不了;确立付费义务反而会给他们第一次创造谈判筹码。其三,文件引「《纽约时报》自己的作者也在用大模型」来反讽原告,但那条引证的出处是一起未按时报规则披露的 AI 使用争议——用对方的违规来论证对方离不开你的产品,论据本身就是歪的。

接下来该盯什么

一,主审法官会不会理会这份声明。「利益声明」不产生判决效力,但这个签署层级等于把政治压力摆上了案卷。

二,国会。文件一面转述许可框架的建议,一面把「要不要重写版权原则」推给国会,盯有没有配套草案——那才是「训练要不要付费」的真正答案。

三,其他司法辖区的连锁反应。欧盟的文本与数据挖掘例外、英国的例外争议、日本的宽例外,会不会陆续被「产业竞争力」话语重写。

四,美国版权局。文件顺手批驳了版权局 2025 年的生成式 AI 训练报告,还提到版权局局长正为自己的职位打官司——这个机构在 AI 版权问题上的话语权正在被架空。

这案子最值得盯的不是输赢。NYT 诉 OpenAI 再打两年,判出来的也只是一纸判决;真正在定型的是「训练数据的产权」被放进哪个框架——放进法律框架,双方还能谈判;放进产业政策框架,内容方连出场的资格都没有。