「训练是合理使用」:美国把这句话,从法庭文件搬上了 G20 的谈判桌

2026-09-03 · 版权 · AI治理 · 训练数据 · 公平使用 · 政策
「训练=合理使用」正从一家公司的诉讼抗辩升级为美国的国家立场,版权争议的裁决重心开始从法院移向贸易政策;但判决权仍在法院,补偿机制仍是空白。

先说结论

9 月 2 日,美国司法部在《纽约时报》诉 OpenAI 的案子里,替 OpenAI 交了一份简报:用受版权保护的作品训练大模型,一般应算合理使用(fair use)。同一天,商务部长卢特尼克在北卡罗来纳举行的 G20 科技会议上,劝其他国家也这么办。

两件事单看都不算大新闻,合在一起才是信号:训练数据的版权问题,正在从法院搬进贸易谈判——争议的焦点从「这个案子怎么判」,变成了「各国该立什么规矩」。

事情是怎么发生的

先看法庭。《纽约时报》诉 OpenAI 是训练数据版权最关键的未决案件之一。司法部这份简报的原话说,美国「在继续发展一个强健而有竞争力的人工智能产业方面有强烈利益」,又说「在对合理使用原则的误解之下约束大模型开发,将阻碍这种创造性与科学进步」。简报还援引了 2025 年 1 月那份「扫清美国 AI 领导地位障碍」的行政令。要强调:这是政府的意见,不是判决,写简报的人没有审判权。

再看会场。这场 G20 科技部长会议在北卡罗来纳开了两天。9 月 1 日,扎克伯格先劝各国不要限制开放权重模型;9 月 2 日,卢特尼克上台,劝各国拥抱 fair use,让 AI 公司能用创作者的作品训练模型,同时「找到保护艺术家的办法」;黄仁勋在同一场合说,监管应对准真实发生的伤害,而不是「理论上的伤害」。同一天发言的,还有 OpenAI 的奥特曼、Palantir 的卡普和 Anthropic 的联合创始人 Tom Brown。

值得注意的是,判例本来就已经偏向 AI 公司:加州法官 Alsup 在 Anthropic 案里写过,模型读书「不是为了抢先复制或取代原作」,训练本身可算转化性使用;要赔钱的是用盗版书库进书——去年那笔 15 亿美元和解金赔的是这个。所以「训练算合理使用」并不新鲜。新鲜的是,政府把零散的判例收编成统一口径,并且拿去出口。

为什么重要

版权这种事,判定权放在哪,行业的成本结构就长成什么样。由法院逐案判,每个案子都得摆证据:用了什么、伤了哪个市场;由贸易政策定调,规则在立案之前就立好了。这次的变化是后者:国家的产业竞争力被明写进版权论述,创作者的授权问题被悄悄换成了国家的全球地位问题。

对行业,这几乎直接改写前沿模型的成本表:数据不用按册付费,法律风险从「训练端」进一步移到「输出端」——模型有没有背出原文、来源和署名还在不在。

对创作者,谈判桌换了位置:从打官司,变成谈立法与集体授权。而目前唯一有具体数字的锚,是 Anthropic 那 15 亿美元的和解金。

站得住与站不住的地方

站得住的一面:各国规则不一,确实会撕裂「训练数据」这个事实上全球共用的公共品;「训练可以、盗版不行」也确实是一条可操作的界线。

站不住的一面有三处。第一,简报不是判决,主审的 Stein 法官没有被说服的义务;政府一边当产业的冠军,一边给法庭递意见,这个角色冲突谁都看得见。第二,「找到保护艺术家的办法」只有半句,没有机制——是集体授权、按比例分成,还是税收补贴,一个字都没有。第三,fair use 是美国法。欧盟给权利人留了文本与数据挖掘的退出权,日本有自己的宽松条款;把国内判例当国际规范去推销,最容易催生的往往不是跟随,是反弹。

接下来该盯什么

盯三处。一是 Stein 法官在《纽约时报》案里的最终说理:如果法院采纳政府口径,这个立场就有了判例级效力。二是 G20 公报的文本里有没有「fair use」这个词——公报措辞是国际规范成形的第一张纸。三是有没有任何具体的补偿机制被真的写出来:没有机制的「保护艺术家」,只是修辞。

再把视野拉宽一点:慕尼黑法院此前把模型参数当证物的路线,和华盛顿这条「训练免责」的路线,迟早会在同一个问题上撞车——一本书的价值,到底在训练的哪个环节算数。这个答案,接下来一年会在好几个法域分别给出,而且未必相同。