「我们发出来的,不是我们最强的」——Anthropic 这句自述,没有人能核实
先说结论
7 月 24 日 Anthropic 发布 Claude Opus 5,最值得记的不是它在 Frontier-Bench 上刷了 SOTA,而是它在公告里主动说了一句话:这个模型在网络安全上「仍然落后于 Mythos 5」,而且我们是「刻意没有拿网络任务去训练它」的。
这是一次角色转换。过去发模型是宣称「我们能做到这么强」,这次是宣称「我们没让它这么强」。前者能被外部评测检验,后者不行。一个实验室公开断言出货模型低于自家上限,而没有任何机制能核实这个断言——这才是这周真正的新东西。
事情是怎么发生的
时间线拉一下(以下均为 Anthropic 官方页面口径):
- 4 月,Anthropic 宣布内部模型 Mythos Preview 能自主发现并利用软件漏洞,同时启动 Project Glasswing,拉上 AWS、苹果、谷歌、微软、NVIDIA 等做关键软件加固。
- 6 月 9 日,Mythos 5 与 Fable 5 发布,共用同一底层模型:Fable 5 加通用护栏,Mythos 5 拆掉部分护栏、只给受审核伙伴。Mythos 页面写明不公开的理由——其网络安全与生物学能力「先进到可能被滥用于制造网络攻击或危险武器」。
- 6 月 12 日,美国出口管制指令要求暂停这两个模型;7 月 1 日部分美国机构恢复。
- 7 月 24 日,Opus 5 发布,称其在编码与知识工作上 SOTA、价格约为 Fable 5 一半,但「不推进高风险两用能力的前沿」。细节是:OSS-Fuzz 上它找漏洞已接近 Mythos 5,但把漏洞武器化成可用 exploit 的分数远远落后;其分类器放行源码级漏洞发现,拦截二进制扫描、渗透测试和 exploit 生成,触发频率据称比 Fable 5 低约 85%。
请注意:「刻意不训练」「仍然落后」「低 85%」全部是 Anthropic 关于自身安全姿态的自述,由 SiliconANGLE 等媒体同日转述,无独立第三方复算。
为什么重要
因为它把「前沿」悄悄拆成了两个东西:公开可测的前沿,和实验室自己知道的前沿。
以前我们默认这两者重合——最强的模型就是发出来那个,榜单数字大致就是能力上限。现在这个默认失效了。Opus 5 的能力画像不是一条自然曲线,而是被政策塑形过的切片:某些方向刻意不训,某些行为在推理时被分类器截断。你测到的数字,是「训练决定 + 拦截策略 + 发放决定」的合成结果。
它跟之前几件事的机制也不一样。GPT-5.6 那次是外部审查当闸门,METR 那次是被测者知道自己在被测(尺子被污染)。这次是第三种:实验室自己决定哪个版本进入评测视野。闸门、尺子、样本,三处都被动过了。
我的正反评价
站得住的一面。 分层不是纯公关。Epoch AI 的数据显示,2026 年 6 月由 21 家知名机构披露的高危/严重级 CVE 约 1500 条,是 Mythos 发布前月度纪录的 3.5 倍以上;Glasswing 一侧报称累计发现超过一万条高危漏洞。而且把「找漏洞」和「写 exploit」拆开、只放行前者,这个切分点在技术上是讲道理的——攻防不对称正好卡在武器化那一步。
站不住的一面,有两层。
一是那个 3.5 倍撑不起「防守方净受益」,Epoch 自己就把话说在前面了:只统计已公开披露的漏洞、只取 21 家机构,并且这波上涨「可能有一部分是因为大家找 bug 的兴趣变浓了」。兴趣上涨和能力上涨在这条曲线上是混着的,拿它当安全性指标,是把一个带自选偏差的披露量当成了结论。
二是更根本的:「我们刻意压低了它」不可证伪。外部只能测出货模型,分数低——是训练时没喂、推理时被拦,还是本来就不行?三者在外面看长得一模一样。这不是说 Anthropic 在撒谎(几家前沿实验室里它披露算多的),而是说:在这套结构下,「诚实」是自愿行为,不是可验证属性。一旦分层发布成为常态,任何一次表现不佳都可以用同一句话解释掉。
对研究、教学和影像系统的启发
对我们做评测的人,有一条非常具体、马上就生效的后果:你现在跑出来的任何模型分数,都不再是能力测量,而是策略产物的测量。
这对我手上两条线是直接的。做 MetamerBench 这类同色异谱基准、做 CAM-Bench 这类色貌知识评测时,我们习惯写「模型在 X 上的准确率为 Y」。严格讲,从现在起该写成「该实验室公开发放的版本在 X 上的准确率为 Y」,并且这个 Y 是能力下界,不是能力估计。
方法论上两条硬规矩:一是报告必须带模型版本、访问层级和评测日期——同一个底层模型在不同访问层上是不同的被测对象;二是能力结论只做单向陈述:做到了 X,说明至少能做到 X;没做到 X,什么都不说明。
课堂上也好用,当「测量学第一课」:当被测系统的行为可以被制造者按策略调整、而调整本身不可观测时,你的测量还剩下什么?这个问题在颜色科学里不新鲜——我们对相机厂商的白平衡黑箱、对 tone mapping 后的 sRGB 图抱怨过一模一样的事。区别只是,这次黑箱把「我给你留了一手」写进了产品公告。