前沿的门票,跌到了 4000 万美元
先说结论
8 月 24 日,Thomson Reuters 正式发布了自家第一个大模型,名字就叫 Thomson。这家公司做了上百年法律和税务信息生意,Westlaw、Practical Law 都是它的。发布材料里最扎眼的一句来自 CEO Steve Hasker:早期评测显示,Thomson 在一系列任务上与最新的前沿模型持平。
支撑这个说法的数字,比一般发布会实在:团队不超过 36 名工程师和科学家,算力是不超过 368 块英伟达 B200,从立项到一大一小两个型号做完,用了三个月,公司总共投入 4000 万美元。基座不是从零训的——直接拿阿里的开源权重 Qwen3.5-397B 和 Qwen3.6-35B,在上面跑完整条持续学习管线:大规模数据整理、继续预训练、后训练、奖励设计。
技术报告开宗明义,原话是「frontier performance can be achieved by a wide range of institutions through Continual Learning on readily available open-weight models」——前沿性能可以由广泛得多的机构实现,路径就是在现成的开源权重上做持续学习。
这句话如果站得住,改写的就不只是一家公司的命运,而是「前沿」这个词的定义。
事情是怎么发生的
Thomson Reuters 的处境很典型:手里最值钱的从来不是算力,是内容——判例、法条、税务注释、新闻档案,加上贴着律师和会计师工作流的分发渠道。过去它把内容接给别家的模型用;这一次它决定把模型本身攥在手里。技术报告把目标写得明白,叫 SovereignAI:模型、工具链、数据隐私都要在自己控制之下。CTO Joel Hron 的表述是:从一个强基座出发,为真正要紧的工作做深度特化,你就能得到「高度可用、效率高得多、而且完全在你控制之下」的智能。
方法上,他们没走「微调一下」的捷径,也没从零烧钱,而是把开源基座当起点,做了一整套持续学习。报告自称,靠这笔「通常只够跑消融实验」的训练预算,追平了头部公司七个月左右的模型迭代;改进呈 π 形——目标领域大幅上涨,通用能力尽量不掉。
为什么重要
第一,前沿的门票价格崩了。前两年,「前沿」还是少数几家一年烧几十亿美元的实验室的专属形容词;现在一家法律信息公司用 4000 万美元、三个月就宣布入场。这个数字未必家家能抄,但它把「前沿」从一份机构名单变成了一套方法:开源权重、自有数据、像样的训练栈。可以预期,彭博、Wolters Kluwer、Elsevier 这些攥着专业数据的公司,很快会照方抓药。
第二,价值链的重心在挪。当能力可以租、基座可以续训,真正稀缺的只剩三样:别人拿不到的数据、嵌进工作流的分发、以及能证明「确实好」的验证。GPU 反而越来越像大宗商品。
第三,一个不小的讽刺。这家西方专业信息巨头反复强调的「主权」,地基是中国的开源权重。开源权重正在成为事实上的全球基础设施层——谁的基座被世界上多少「主权」项目采纳,比某次榜单排名更值得长期盯。
站得住与站不住的地方
站得住的:数字给得齐,人数、GPU、周期、预算全是可检验的宣称,比「我们内部还有个更强的」那种无法证伪的自述体面得多;方法路线与行业实际走向一致;小型号按学术许可放上了 Hugging Face,并承诺送学界做外部验证。
站不住的也很具体。法律科技媒体 LawNext 把 benchmark 表逐行核过:七个项目里 Thomson 拿下三个;最有名的法律基准 Stanford LegalBench 它是输的,0.823 对 Gemini 3.1 Pro 的 0.843。那个接入 Westlaw 内容后大幅领先的检索测试,测的与其说是模型,不如说是内容库。报告自己承认,编码是唯一出现相对基座遗忘的领域——特化有代价。再加上评测用的是自建框架、各家模型的推理档位也不对齐,汇总成一句话:目前所有「持平」都是自评,外部验证还没有回来。
接下来该盯什么
三件事。一看外部验证:模型已经交到法律和 AI 学者手里,第一批独立结果什么时候出、打不打脸。二看模仿者名单:下一个宣布「我们也有前沿模型」的专业数据公司是谁,名单长短决定 4000 万美元是特例还是行情。三看基座:Qwen 每一次升级都会自动抬高所有持续学习玩家的起点,前沿实验室的发布节奏,正在间接变成别人家的地基。当「与前沿持平」变成一句人人都说得起的话,谁还肯为这句话掏钱做独立验证,那才是分水岭。