当任务比版本活得更久:Noam Brown 说,AI 安全评测的时钟已经错了
先说结论
OpenAI 研究员 Noam Brown 提出了一个比“模型会不会更聪明”更具体的问题:如果一个智能体能连续做三个月的任务,而前沿模型两个月就换一代,我们怎么可能在下一代到来前,完整测完这一代?
这不是又一轮抽象的末日讨论。它指出的是一个日历上的硬冲突:能力按任务时长扩张,安全流程却仍以“发布前做一轮测试”为单位。任务一旦比版本活得更久,评测报告出炉时,被测对象可能已经过时。
事情是怎么发生的
9 月 17 日,Brown 在 Dwarkesh Patel 的播客中讨论多智能体、递归式自我改进和对齐。他说,前沿模型“最多每两个月”发布一次;与此同时,模型正在胜任越来越长的任务。今天可以谈一周,未来可能是一月、三月。若三个月任务遇上两个月发布周期,就无法在完整能力时域上完成发布前评测。
他也明确加了限制:这“现在还不是问题”,但正在快速逼近。三个月自治是趋势外推,不是已发生的实测事实。当前最接近的公开证据来自 METR:其 2026 年更新显示,模型的人类等效任务时长仍在指数增长,但长任务样本很少,最新模型的置信区间仍很宽;而且这个指标衡量的是任务对人类有多难,不等于智能体真的不间断运行那么久。
为什么重要
过去的安全评测像汽车碰撞测试:冻结一个产品,撞完,再决定能否上市。长时程智能体更像一家持续经营的公司。风险未必出现在第一小时,而可能来自第十次交接、第三周的记忆漂移、工具权限累积,或一个局部错误经过几百步后被放大。
因此,未来真正稀缺的不是更大的题库,而是持续评测能力:上线后不断抽查轨迹、设置阶段性检查点、限制权限随时间扩张,并让关键任务能够暂停、回放和追责。一次通过,不能再被理解为长期安全。
站得住与站不住的地方
Brown 站得住的地方,是把“长任务能力”与“发布节奏”放到了同一把尺上。即使模型完全没有欺骗意图,长时间运行也会暴露传统短测看不到的可靠性衰减。这既是安全问题,也是产品质量问题。
但他的论证也有明显跳跃。公开测量主要集中在软件、机器学习和网络安全等较干净、可判分的任务;现实工作充满模糊目标、人员协作和环境变化。从数小时的人类等效任务,推到稳定运行数月,中间不是简单画一条指数曲线。更慢的发布也不是免费答案:它会扩大实验室内部模型与公众可用模型之间的能力差距,Brown 自己也承认这里没有现成解法。
接下来该盯什么
第一,看评测是否从“发布前快照”变成覆盖训练、内测、上线和长期运行的连续制度。第二,看实验室是否公开长任务中的失败率,而不只公布能做多久。第三,看监管要求是否开始规定评测时域、停止条件和日志留存,而不只是列一张能力门槛表。
真正的分水岭,不是智能体第一次完成三个月任务的那天,而是行业是否在那之前承认:安全评测也必须和任务一起活那么久。