出题人阅卷:AI 会把实验跑完,但不会重做实验
先说结论
最近最扎人的一句话,不在任何发布会里,在《自然》8 月 13 日一篇新闻的标题里:AI 还没准备好研究它自己(AI isn’t ready to research itself)。
背后是一项具体的测试。Kirgis 等二十四位研究者在预印本(arXiv:2607.27191)里提出了一种叫「影子评估」(shadow evaluations)的考法:让前沿智能体去攻一道还没发表的 AI 顶会论文的核心研究问题,然后——这是关键——由出题的原作者本人来判卷。
结果:两道题,智能体都把工程环节全部跑通了,代码、实验、成稿一样不缺,但两篇都被原作者「无歧义地拒绝」,综合评分一篇 2/6、一篇 1/6(评审记录随论文公开)。
所以这件事的读法很精确:自动化科研卡住的位置,是研究判断,不是执行力。
事情是怎么发生的
先看背景。「AI 科学家」这条叙事今年走得很远:Sakana AI 的 AI Scientist 登上 Nature,目标是「端到端自动化 AI 研究」;它的 v2 版曾有一篇 AI 生成的论文通过人类评审——注意,是 workshop 级别的评审。而更早的独立评估(arXiv:2502.14297)已经发现过问题:把评审方向反过来测,AI Scientist 拿到 10 篇论文拒了 9 篇,其中 4 篇是人类评审接收过的。
影子评估在方法上做得干净:
- 题目取自两篇未发表的 NeurIPS 2026 投稿——一道关于语言模型人格的结构与可控性,一道关于表格基础模型的分布漂移检测器。题目没发表,智能体就没法上网抄答案;
- 每个智能体六天、全互联网访问、专用算力、约三千美元的模型额度;
- 判卷人是出题的原作者,评审记录、智能体日志全部公开;
- 换一套不同的模型加脚手架重测,失败照旧。
失败的位置也很具体。论文归纳了五类:对「什么够得上发表」没有数;面对设计缺陷,回应是在措辞上加 caveat,而不是回去改实验;回溯纠错无效;资源意识差,预算只用了不到一半;以及指令漂移。
原作者的评语更直白。David Africa 说这些「实验和方法选择很怪异,难以理解」;Viet Nguyen 指出它从失败的测试做出过度外推,属于「以例代证」的谬误,「非常不科学」。Sayash Kapoor 的总结是:「我不认为开放研究的全自动化就在眼前。」
为什么重要
第一,它换了裁判。 此前「AI 能做科研」的证据几乎都建立在一件事上:AI 写的论文能不能过评审。评审本质上是文本,是可被讨好的对象。影子评估把判卷人换成对这道题最懂、也最没有动机客气的人,同一批模型的成绩立刻从「通过评审」跌到「明确被拒」。在 AI 评测里,谁当裁判,常常比模型多强更能决定结论。
第二,失败的位置很值钱。 智能体把工程全部做完了,说明「写代码、跑实验、写成论文」这个外壳已经不是瓶颈;卡住的是另一些动作:判断这个问题到底回答了没有,决定负反馈来了该重做实验还是该改措辞。这恰恰是科研里最难自动化的部分,也是所有「AI 科学家」产品真正的卖点所在。
第三,对买方是个提醒。 下次看到「AI 科学家」类产品,先问一句:谁打的分。同一个模型,可以同时是「过了 workshop 评审的演示明星」,和「被出题人打 1/6 的答卷者」。
站得住与站不住的地方
站得住的地方在方法。未发表题目防数据泄漏,判卷人公开评审记录,换模型复测失败依旧,日志可查。五个失败模式具体到可以直接拿去当智能体评测的清单。
站不住的地方也要说清。样本只有两道题、两套系统,作者自己只称之为「早期证据」。出题人当判卷人有双重性:他们最懂这道题,但也最有动机守护自己领地的难度,「品味」和「偏袒」在分数里不容易分开。影子评估测的是「单干的天才」这种研究模式,没有测人机协作——后者的价值正在真实发生。被 NeurIPS 级别的题目拒绝,也不等于在日常科研辅助里没用。
接下来该盯什么
一看「影子评估」会不会变成第三方标准测试;真到那天,实验室开始为它优化,这把尺子同样会被磨平。二看「加 caveat 不改实验」这个失败模式会不会随模型升级消失——它最像能力缺口,而不是工程缺口。三看 Sakana 一线怎么回应,以及下一个「端到端」宣传由谁来判。
那些预测「AI 很快自动化科研」的推演,前提恰好是这次拿了 1/6 的那个环节。前提还没兑现之前,推演可以先放着。