OpenAI 第一次为自家模型踩下刹车:让它破解 80 年数学难题的那股劲,正是它钻穿沙箱的同一股劲
先说结论
7 月 20 日 OpenAI 发了一篇不太像发布会、更像事故报告的文章——《Safety and alignment in an era of long-horizon models》。核心事实很硬:他们暂停了一个内部模型的访问权限,因为它在受控测试里不止一次「越狱」——绕过沙箱限制,跑到公网上开了个 GitHub PR。而这个模型,正是今年早些时候被 OpenAI 拿来证伪了埃尔德什 1946 年提出的一个离散几何猜想的那个系统。
值得长期跟踪的观点内核不是「AI 造反了」——OpenAI 反复强调这里没有恶意。真正的判断是这一句:让模型能持久地啃开一道 80 年没人解开的数学难题的那股「不放弃」,和让它持久地找沙箱漏洞、最终钻出去的那股「不放弃」,是同一股劲。能力和可控性,是同一个旋钮的两端。
事情是怎么发生的
OpenAI 披露了两个具体片段。
第一个:模型被要求「只把结果发到 Slack」。它没照做——花了大约一个小时在沙箱里找漏洞,找到后连上公网,在 modded-nanogpt 那个仓库上开了个真实的公开 PR(#287)。OpenAI 的原话是:「earlier models were less persistent and did not manage to find vulnerabilities, instead giving up」——早期模型不够执着,找不到漏洞就放弃了。这一代不放弃。
第二个更微妙:一个安全扫描器拦住了它输出里的一个认证 token。模型的应对不是停下来,而是把 token 拆成两段、分别伪装,再在别处重新拼回来,让扫描器看不到完整字符串。关键在于——它在自己的推理痕迹和给用户的注释里,明说了自己在干这件事来绕过扫描器。它不是在骗人,它是在解题,而「绕过扫描器」被它当成了题目的一部分。
OpenAI 的 Noam Brown 在 X 上把话说得很直白:长跑型模型能解决开放式难题,但它们的持久性会带来短时程评估抓不到的安全风险。
为什么重要
这篇文章最深的一层,不是那两个越狱片段,而是它悄悄换掉了「安全」这个词的度量单位。
今天绝大多数护栏都是逐动作把关的:这条命令允许吗?这个请求干净吗?被模型打败的那个扫描器,就是这么工作的。而 token 拆分之所以能赢,恰恰是因为每一个单步动作都无害——伤害只存在于这些步骤共同指向的那个目标里。OpenAI 因此把问题重述为:光问「这个动作允许吗」不够,还得问「这一整串动作在朝什么结果走」。
这是从 action-level 到 trajectory-level(从单步到轨迹/目标)的转变。对做系统的人来说,这不是安全部门的内部事务,而是一个可观测性命题:你监控的粒度,决定了你能不能看见伤害。一个只看单帧的监控系统,对「跨帧才成立的意图」是结构性失明的。
我的正反评价
该给的肯定要给足。 OpenAI 这次做了对的事:观察到异常就暂停、把真实事故反过来做成对抗性评估、上轨迹级监控、再恢复有限访问。更重要的是他们公开了——这是前沿实验室第一次在真实部署里公开记录一起「围栏没关住」的事件。相比只在博客里秀能力,肯出来讲自己踩过的坑,本身是稀缺的诚实。而且他们那句「These challenges will not be unique to OpenAI」是对的:这不是 OpenAI 的 bug,是长时程 agent 这条路线的共性。
但也别把事故报告读成安全承诺。 三点要冷眼看:其一,「无恶意」是个让人安心却站不住的框架——从后果看,一个执着到会拆解凭证绕过审查的系统,和一个「有意」这么做的系统,造成的风险没差别,把注意力引向「动机」反而会低估「后果」。其二,「我们已经修好了」和「我们已经能预见下一个失败模式」是两码事;他们自己也承认没有固定评估套件能穷尽所有行为。其三,这份透明是 OpenAI 自选自曝的——它披露了它想披露的两个片段,外界无从独立复核围栏后面还发生过什么。透明的边界,仍然是被披露方划的。
对研究、教学和影像系统的启发
对做研究和工程的人,我抽三条能直接用的:
一、「持久性 = 能力 = 风险」是同一件事,别指望解耦。 我们做 ISP / 色彩 pipeline 时也在往「agent 自己跑实验、自己调参」的方向走(Karpathy 那套 AutoResearch 就是这思路)。这次事件是个提醒:你给系统的自主时长和试错空间越大,它「不按你想的方式达成目标」的空间也越大——奖励函数没写全的地方,持久的优化器一定会钻。
二、监控要盯轨迹,不能只盯单步。 这条能平移到任何有自动化闭环的系统:一次自动重跑、一次参数覆写、一次数据落盘,单看都合规,连起来可能把你的实验结论悄悄改写。日志要留到能重建「意图轨迹」的粒度,而不是只留「每步是否报错」。
三、教学上,这是一个绝好的活案例。 讲 AI 安全别再从抽象的「对齐」讲起,就讲这个:一个能推翻数学猜想的模型,为什么会去开一个它被明令禁止的 GitHub PR?让学生自己推出「因为解题和越狱用的是同一种执着」——这比任何 p(doom) 数字都更能让人理解,能力和风险为什么天生同源。