「评测挖出两个真实 0-day,然后照常上线」——第一个跨过「Critical」的模型,和这一周竖起的三道闸门

2026-09-05 · AI安全 · 模型发布 · 网络安全 · 治理 · 开源
网络安全能力正被前沿实验室集体按「能力定级+审查准入+排期松绑」来治理,但「防御者是否跟上」的判定尺子仍握在发布方自己手里。

先说结论

9 月 3 日,OpenAI 发布 GPT-6 Astra。发布稿里最重的一句话不是跑分,而是这句:Astra 在自家 Preparedness Framework 的网络安全维度上跨过了 Critical 阈值——OpenAI 自报旗下模型第一次到这一档。配套数字是 ExploitBench 满分 100%(上一代 GPT-5.6 Sol 为 78.5%),以及一个少见的披露:评测过程中,模型自己挖出并利用了两个此前未知的零日漏洞,OpenAI 已把漏洞报给维护方。

一个在评测里产出真实 0-day 的模型,照常上线,几天内推给所有付费用户。而它前后的 72 小时里,三家实验室做的是同一件事。

事情是怎么发生的

把这一周排在一起,格局很清楚。

9 月 1 日,Anthropic 发 Claude Fable 5.1 与 Mythos 5.1,官方页面明说这是「同一个模型、不同级别的防护」:普通版全网可用;Mythos 只走受审的准入通道——面向防御者的 Cyber Verification Program、与美国政府合作搭建的生命科学通道,目前只对一批美国机构开放。

9 月 2 日,Google 发 Gemini 3.8 Flash 与 3.8 Flash Cyber。Cyber 版换上「更宽松的缓解措施」,只通过新设的 Fairwind Program 发放,对象是政府机构、关键基础设施运营者和软件维护者。

9 月 3 日轮到 OpenAI:Astra 上线版本会拒绝「为漏洞写概念验证利用」这类高级攻击任务,同时预告通过 Daybreak 项目「未来几周内扩大访问、放宽限制」。

同周,开源侧的后续也到了。Z.ai 8 月 14 日发布 GLM-5.3 时承认「post-training 扩大后,网络攻击能力的增长超出了我们的预期」,宣布权重推迟两周、做完安全评估再放;这几天,753B 权重已经挂上了 Hugging Face。

最值得注意的是一个新现实:测量能力这个动作本身,现在会产出需要走漏洞披露流程的东西。Z.ai 顺手公开了一个披露台账——GLM-5.3 在 269 个真实项目里找出 2436 个漏洞,最老的一条是 1981 年埋下的。实验室第一次同时是模型厂商和漏洞来源。

为什么重要

第一,治理对象换了。三家的重心从「把能力对齐掉」挪到了「发给谁、何时放」,而且用的是同一套模板:同一个底座,普通版收紧,专家版定级、审发、限对象发放。能力分级是标尺,CVP、Fairwind、Daybreak 这些名字化项目是闸门,发布日程本身就是安全策略。

第二,「防御者窗口」从修辞变成了产品节奏。三家给出的理据是同一个:前沿攻防能力先交给防御者,等防御方跟上再逐步放开。这是一个可证伪的时间窗判断——它成立与否,取决于防御者是否真的在补上,而不是取决于声明。

站得住与站不住的地方

站得住的部分:能力数字可查、可跨实验室对。ExploitBench、CyberGym 这批基准是各家共用的,Z.ai 用它们自测出「落后闭源前沿、差距随攻击链上移而拉大」的结论,与各家自报的排序一致;0-day 披露与公开台账也是可核验的动作。

站不住的至少有三条。其一,放宽是写进发布稿的默认动作:OpenAI 承诺几周内放宽,但「防御者跟上了」由谁认定、按什么判据认定,一个字没提。其二,闸门钥匙都在发布方手里:准入标准、名单、松绑条件都不对外,安全制度与产品分层是同一件事——防御者同时是个市场。其三,OpenAI 在同一篇公告里承认,Astra 的书面推理比上一代更难监控;恰好是跨过红线的那个模型,更难被看着。至于开源侧,权重一旦放出就收不回,时间闸门只能买几周,买不来「之后」。

接下来该盯什么

一看 Daybreak 的第一份成绩单:几周后放宽多少,判据会不会公开。二看 Fairwind 这类项目的名单与标准会不会变得可审计,政府是把它们收编成正式制度,还是继续留给厂商自理。三看 GLM-5.3 权重放出后的真实世界:有没有滥用案例、披露台账里的漏洞有没有被抢修。整个框架都押在「窗口期内防御者确实跟上了」这个假设上——它第一次有机会被实证检验。