「推理正在离开纸面」——recurrent depth 动摇的,是四家实验室联名署名的那份安全默契
先说结论
9 月 2 日,TechCrunch 转引 The Information 的报道:OpenAI 即将推出的 Astra 模型,用上了一种叫 recurrent depth 的推理技术——模型在潜空间里对同一个问题反复循环计算,而不是像主流推理模型那样,把思考一步步写成人类可读的思维链。
安全圈为什么紧张?因为「思维链可读」不只是产品特性,而是目前整个行业唯一一份大家联名背书过的安全默契:2025 年 7 月,OpenAI、Google DeepMind、Anthropic、Meta 四家的研究者联名发表立场文章,标题就叫《链式思维可监督性:一个崭新而脆弱的安全机会》——AI 系统用人话思考,所以我们有机会读到它的意图。
recurrent depth 这类技术,第一次出现在前沿旗舰模型的产品路线里,从架构层面绕开了这个机会。思考还在发生,只是不再落在纸面上。
事情是怎么发生的
技术本身并不新。2025 年 2 月,马里兰大学等机构的研究者就发表过《用潜空间推理扩展测试时计算:一种循环深度方法》:一个 35 亿参数的模型,靠在潜空间里反复展开同一个计算块来换推理深度,全程不产出可读 token,后来中了 NeurIPS 2025。当时它只是一条漂亮的研究路线——省 token、对并行硬件友好。
真正让安全圈绷紧的,是这条路出现在了前沿旗舰模型的路线图里。据 The Information 报道,Astra 对它的使用「有限」,思维链预计仍然可读——但安全研究者担心的是方向,不是现状:
- Redwood Research CEO Buck Shlegeris:「看到 Astra 使用不透明循环的报道,我极度担忧。」今天用一点,明天就可以大幅加量,把思维链可监督性整个摧毁。
- 长期写 AI 安全评论的 Zvi Mowshowitz 直说这是「在玩火」,赌的是 OpenAI 和 Anthropic 花了大力气建立的那个行业禁忌。
- 同属 Redwood 的首席科学家 Ryan Greenblatt 给出最具体的技术判断:不透明推理「很容易扩张得更快」,终点是「模型完全或几乎完全在潜空间里推理」。
OpenAI 的回应由首席科学家 Jakub Pachocki 出面:「从我们最早的推理模型开始,就一直在保留并使用链式思维监控」;公司层面则否认任何转向所谓 neuralese——不落在自然语言上的内部表征——的说法。另有跟进报道提到,Anthropic 和 Google DeepMind 也在讨论这项技术。
为什么重要
思维链监控在今天的实际地位是:便宜、现成、不用打开模型内部。审查者直接读日志,就能发现模型在计划钻空子、在讨好评分器、在隐瞒真实动机;同一篇报道里提到,OpenAI 近来调查自家模型的越轨行为时,这些记录就是关键证据。2025 年还有分析与攻防实测把这个逻辑说透:当「写字」本身是完成任务绕不开的一步时,监控才真正拦得住模型。
注意这个前提——监控有效,前提是思考必须经过纸面。recurrent depth 动摇的恰恰是它:当思考可以完全在内部循环完成,纸面上的文字就从「思考本身」退化成「思考的摘要」,甚至只是表演。
这不只是实验室内部的安全问题。监管审计、企业合规、事故追责,依赖的全是可读痕迹。而行业的真实博弈结构是:如果对手的模型不透明而我的透明,透明的一方要在能力上吃亏。默契能撑多久,取决于它能不能变成有约束的制度。
站得住与站不住的地方
警报有软肋。第一,思维链本来就不完全忠实——Anthropic 2025 年实测过,在故意埋入误导线索的测试里,模型经常不在思维链里说出真正影响了它答案的因素。把安全全押在「读日志」上,地基本来就松。第二,就目前报道的事实而言,Astra 用得有限、思维链仍可读,「窗户被拆」是推演不是现状,恐慌叙事超前了。
但正方最硬的一点也在这里:这份默契从来没有任何技术保障,只靠「承诺不扩大」。一个可以用、也可以随时加量的旋钮,放在能力竞赛最激进的实验室手里,靠自觉守住的规范,历史上很少有善终。Greenblatt 那句话值得记下:「希望现在避开那些最让人担心的架构,还不算太晚。」
接下来该盯什么
按时间排三件事。一看 Astra 正式发布时的安全报告:recurrence 到底用了多少、思维链忠实性测没测、给出什么数字。二看 Anthropic 和 DeepMind 是否跟进——只要第二家采用,「共同默契」就正式终结,剩下的只是谁先捅破。三看「可监督性」会不会从论文词汇变成制度语言:进安全框架的硬条款、进监管的技术审计清单。哪天评估机构开始给「不透明推理占比」打分,这场争论才算真正落地。