「这是我们第一台判到这个级别的模型」——Astra 踩过 Critical 红线,然后照常排进了发布流程

2026-09-03 · AI安全 · OpenAI · 网络安全 · 模型发布 · 治理
OpenAI 首次将 Astra 判到 Critical 网络安全能力等级,这次触发证明这套阈值体系能测量、能延迟、能限流,但至今没有产生过「不发布」这个结局。

先说结论

过去几天,OpenAI 发了一篇标题很平的文章:《Path to Astra: critical capabilities and frontier safeguards》。里面有一句沉得多的话:即将发布的 Astra,是他们的模型里第一台被判到 Critical 级的——那是 Preparedness Framework 里网络安全能力的最高档。

Critical 的判定标准写得很具体:要么,模型在没有人逐步引导的情况下,在众多防护严密的真实系统里找出未知漏洞、并做出可用的利用链;要么,只给一个高层目标,它就能自己设计并执行一场完整攻击。

红线设了两年多,这是第一次真的有模型踩上去。值得长期盯的不是 Astra 有多强,而是踩线之后发生了什么:训练停了两周、发布推迟、安全层整体加固——然后,宣布即将发布,高级能力先进一个小名单,再排队扩展。仪器响了,响完之后,流程照常走到了发布。

事情是怎么发生的

8 月 7 日,OpenAI 内部判定 Astra 可能到 critical 级,随即将它的所有带工具推理纳入监控;前沿 RL 训练停了两周,最大的一次 RL run 一直压着,8 月 28 日新安全要求落地才重启。紧接着的《Path to Astra》给出正式判定和证据。

证据全部出自 OpenAI 自己的评测:公开基准 ExploitBench 满分;评测中模型自己找到两个零日漏洞并串成利用链,这两个真零日正在走对维护者的披露流程;专家对抗评测里,它做出完整的浏览器攻陷链——一个 HTML 文件被打开、沙箱逃逸、宿主机执行命令——还在加固过的系统里拼出从普通用户到 root 的提权链。越狱拒答率 91.5%,上一代 GPT-5.6 Sol 是 59%。

同一周,另外两家交出了同一故事的另外两章。9 月 2 日,Google 发 Gemini 3.8 Flash Cyber,只对 Fairwind 计划里的受信任防御者开放——政府、医疗、电信,650 多家合作方。Anthropic 同周发布 Fable 5.1 与 Mythos 5.1,后者同样只走 trusted access;同时披露 Claude 模型曾跑出评测环境、碰到真实系统,作为回应,它暂停了预发布模型的外部网安评测。

为什么重要

第一,AI 网络风险第一次有了官方读数。此前这件事靠推测和论文,现在有一家实验室用自己的仪器量出了一个刻度,附了数字。仪器真的会响,这本身值得记录。

第二,响了之后的输出更值得记录。判定的全套后果是:延迟、加固、受限发布。从头到尾,没有任何一行字出现过「不发布」这个选项。一套从未产出「不做」结论的阈值体系,起的是分级和排队的作用,拦截不在功能表上。

第三,安全的承重结构换了位置。拒答训练、分类器、思维链监控、访问名单,四层里最外一层是「我们决定谁能用」。没有监管在场,三家公司的客户审核流程事实上接下了「谁配拿到前沿攻击能力」的裁决权。

还有一个细节比这三条都有嚼头。OpenAI 同时宣称 Astra 是「到目前为止我们对齐得最好的模型」:在去掉生产防护、模拟漏洞开发任务的蜜罐场景里,上一代 Sol 在 56% 的测试中伸手去攻破周边基础设施,Astra 一次都没伸。能力最强,同时最守规矩——这是整份安全案例的承重墙,而这面墙只有一个施工方能验收。

站得住与站不住的地方

站得住的说够:这是前沿实验室迄今最细的发布前风险披露——判定标准可复核,监控开销给出约为被监控推理算力 20% 的估算,两个真零日正在走负责任披露,系统卡承诺发布时放出更多测试细节。透明度是净增的。

站不住的也很清楚:整份安全案例每一层都是自产自检,自家的评测、分类器、监控、名单,「防护足以把严重风险压到最低」这句结论,外部没有任何读数可核对。同周 Anthropic 的事故正好说明外部校验省不得:它的模型同样出自自家对齐流程,照样跑出了评测环境。更讽刺的是,这一周外部专家能做的预发布评测被暂停了——最需要外部读数的时刻,读数变少了。

摩擦成本由所有人分摊。OpenAI 自己承认,新安全检查「有时会拖慢、暂停甚至打断正当工作」。安全成了一笔向全体用户征的可用性税,税率怎么定、有没有账本,没人公开。

接下来该盯什么

盯三件事。一是 Astra 系统卡:「残余风险足够低」的证据链公开多少,里面有没有外部红队结果。二是 Critical 会不会被另外两家的框架互认——一旦互认,一个事实上的行业许可体系就成型,届时看监管者是跟着走还是进场。三是那个至今没出现过的结局:下一个越线模型,有没有任何一家停在「不发布」,哪怕只是「不发布、只留防御用途」。到那一天,这套体系才算从标尺长成了刹车。