「谁拿到」从来不是那道闸——OpenAI 这周把安全边界画在了能力等级上
先说结论
8 月 10 日,OpenAI 扩展了它的网络安全计划 Daybreak,拆成 Blue 和 Red 两档,并发布了专门训练的 GPT-5.6-Cyber。对外的故事是「把前沿智能交到可信防守者手里,赶在攻击者部署之前」。
但真正决定这次能发出来的,不是审核名单做得多严,而是这两个模型在 OpenAI 自家 Preparedness Framework 的网络安全维度上都只到 High,没有顶到 Critical。三天前顶到 Critical 的那个模型(Astra),到现在还在架子上。
所以这周被画出来的那条线,是能力等级,不是分发对象。外界一直在争论「该给谁」,而实验室内部真正在用的开关是「到哪一级」。这个区分值得记住。
事情是怎么发生的
8 月 7 日,OpenAI 表示无法排除 Astra 具备「关键级」网络能力——这是它第一次给自家模型贴上这个最高档,随后暂停了相关内部活动、推迟发布,并知会了白宫。
三天后,8 月 10 日,同一家公司做了看起来相反的事:Daybreak Blue 把 GPT-5.6 Sol 的系统级网络安全拦截层去掉,给通过身份核验的防守方使用;Daybreak Red 提供 GPT-5.6-Cyber,用于经授权的漏洞研究与利用验证,只对已审核的合作机构开放,且模型访问权留在合作方,不转交给终端客户。个人账户从 9 月 1 日起强制硬件密钥。
OpenAI 给的理由很直白(据 TechCrunch 与 BleepingComputer 引述其公告):威胁方会以「前所未有的速度和规模」用 AI 发起攻击,包括完全自动化的方式,而「防守方准备的窗口正在收窄」。战果也摆出来了:用它去查 Chrome 的 V8 引擎,挖出两个此前未知的漏洞,可以串成堆沙箱逃逸,Google 已修复,编号 CVE-2026-15903。
为什么重要
这是我第一次看到一家前沿实验室把「攻防平衡」这个抽象赌注,做成了可执行的产品分级:Critical 封存 / High 定向分发 / 其余公开但带拦截。以前关于「能力保留」的讨论只有发或不发两个选项,现在有了第三档语法。
它顺带暴露了一件被公共讨论长期忽略的事:拦截层不是能力层。Blue 的做法不是给你一个更强的模型,而是把同一个 Sol 前面的筛子撤掉——能力一直都在那儿。于是「开源权重更危险还是更安全」这个吵了半年的问题其实问偏了,真问题是「那层筛子有多容易被拆」。OpenAI 自己给出了答案:对它自己来说,拆掉只是一个账号开关。
站得住与站不住的地方
站得住的一面:方向判断很可能是对的。防守方的结构性劣势是真的,V8 那个案例也不是纯公关——有安全公司反馈,模型在一天内做完了此前几周没推进的工作。分档也确实比「一刀切公开」或「一刀切封存」更贴近工程现实。
站不住的一面:用来支撑这个判断的数字是坏的。它的头号指标叫 Advanced Cybersecurity Completion Rate:Cyber 版 95.0%,Blue 下的 Sol 2.0%,公开版 Sol 1.5%。看名字就知道它测的是「模型愿不愿意接这类请求」,不是「防守方因此多修了几个漏洞」。那个 47 倍的差距,主要是拒答率的差距。拿它论证「防守方获得了实质增益」,就是把一个行为开关当成能力指标——教科书级的 metric trap。而且 system card 还没发。
更关键的是:这个赌注现在无法证伪,但它并非不可测。可测的东西是现成的——同类漏洞从披露到补丁上线的时间有没有缩短、经审核的定向分发是否真的跑得比能力外泄更快、拿到 Red 的机构实际修复率如何、对不上账时会不会公布。只要这些都不测,「先给防守方净收益为正」就永远只是一个立场,不是一个结论。
这对行业意味着什么
第一,指标的名字通常已经承认了它测什么。 Completion Rate 就是应答率,它没打算伪装。我们做 ISP 和画质评测时踩的是同一个坑:一个数涨了跌了,先问它约束的是哪个行为,而不是先给它编解释。
第二,这是很好的课堂材料。 给学生一张 95.0 对 1.5 的表,只给指标名字,让他们判断能不能得出「更强」的结论——比讲十遍「不要迷信 benchmark」有用。
第三,能力发布的门槛正在从「能不能做」转向「能不能被度量」。 这和影像领域正在浮现的那个问题是同一个:真正稀缺的不是更高的完成分数,而是证明某个能力对下游决策是充分的。谁能先把「充分」定义出来并测出来,谁就在定规则——这次是网络安全,下一次可能就是影像系统里的「这张图够不够用来做判断」。