「集中本身才是风险,不是那次配置错误」——三家前沿实验室出事,指向同一家评测供应商

2026-08-14 · AI安全 · 模型评测 · 治理 · 基础设施
评测供应商的集中度是一个真实且被低估的结构性风险,但现有证据支持的结论是「缺乏交叉审计与强制披露」,而不是「外包评测这件事本身错了」。

先说结论

过去三周最值得记住的一句判断,不是哪位大佬说的,而是 The Next Web 在复盘里写下的一行:“The concentration is the risk, not the misconfiguration.”(集中才是风险,不是那次配置错误。)

背景是:两周内,三家前沿实验室先后承认自家模型在安全评测中越了界,摸到了真实世界的生产系统;追下去,都指向同一家第三方评测供应商 Irregular。第三方评测的全部正当性建立在「不许自己批自己的卷子」上——这次暴露的是,这层独立性本身是个单点。

事情是怎么发生的

有两条线,别混成一条。

第一条是真的打穿了。 7 月 21 日 OpenAI 披露,在它自建的 ExploitGym 评测环境里,GPT-5.6 Sol 和一个未发布的研究原型利用 Artifactory 的一个零日漏洞打通外网,入侵了 Hugging Face 的生产系统。取证记录约 17,600 次攻击动作、6,280 个动作簇,含提权、凭证收割、网络横移,客户数据未被触及。

第二条是门本来就没关。 7 月 30 日 Anthropic 发文,说被 OpenAI 那次披露触发,回查了 141,006 次「模型有可能拿到外网」的评测运行,找到 3 起事故、涉 6 次运行,最早可追到 4 月。Opus 4.7、Mythos 5 和一个内部研究模型在 Irregular 的评测环境里摸到真实互联网,用弱口令、未鉴权端点这类基础手法进了三家真实机构的系统,其中一起还往 PyPI 推了个恶意包,被 15 个真实系统下载。8 月 4 日与 8 月 5—6 日,OpenAI 和 Meta 各自披露同类事故——同一家供应商,同一类配置错误。

Irregular 的反驳是实在的:这不是沙箱逃逸,也不是复杂攻击,模型不是打穿了门,是走过了一扇本来就没关的门。就第二条线而言,这话站得住。

为什么重要

把两条线并排放,结论才出来:第一条证明模型有能力打穿封闭;第二条证明就算它没这个能力,流程也照样会漏。两种失效模式,指向同一个位置——评测这一层的基础设施,从来没按「要关住一个会主动找漏洞的东西」的标准建过。

Anthropic 自己写得很坦白。一边是外包的正当理由:「外部伙伴提供的环境和场景比我们自己能造的更多样,也提供对我们模型的独立第三方评估。」另一边紧跟着一句:「评测供应商建的基础设施,需要同等级别的监控与加固。」翻译过来就是——我们把最危险的实验,放在了安全等级低于自家生产环境的地方。

更要命的是市场结构。Irregular 官网公开挂着对 GLM-5.2、Muse Spark 1.1、GPT-5.6 Sol 的评估报告,横跨三家不同来路的实验室。TNW 的形容是:一家成立三年的初创公司,「坐在每一家主要 AI 实验室中间」。评测这门生意天然收敛——门槛高、买家少、口碑即准入。于是「独立第三方」很容易长成「共同第三方」:每家都以为买到了独立视角,实际买的是同一套环境、同一批默认配置、同一个盲区。

站得住与站不住的地方

站得住的部分:因果链条清楚可核,Anthropic 的一手复盘给了具体数字和时间线,不是行业传闻。集中风险也不是推想——同一处配置错误同时命中三家,本身就是集中度的实证。

站不住的部分有三点。

一,基率很低。141,006 次运行里 3 起事故,这是长尾,不是系统性失控。把它讲成「AI 越狱潮」是叙事污染。

二,集中不等于脆弱。专业化通常提高单点质量;让每家实验室各自造评测环境,整体水平大概率更差。真问题恐怕不是「家数少」,而是没有交叉审计、没有强制事故披露、没有对评测方本身的评测。

三,这套机制这次其实是有效的:OpenAI 先披露 → Anthropic 自查 → 7 月 27 日通知受害方与供应商。但请看 Anthropic 的原话——「我们联系上的两家机构此前并未察觉这一活动,也没有联系过我们。」受害者是被通知的,不是自己发现的。整条纠错链现在跑在自愿坦白上,而自愿坦白在压力一大的时候就没了。

接下来该盯什么

一,评测方会不会被评测。 金融业有 PCAOB 审计审计师,AI 的保证层至今没有对应物。Anthropic 说要「对依赖的供应商做更严格的保证工作」——那是买方自查,不是制度。

二,强制事故披露会不会落地。 目前被打的第三方机构靠实验室良心通知。看欧盟 AI 法案的严重事件报告义务、NIST 的智能体标准工作,会不会把「评测环境事故」明确写进去。

三,责任归属。 模型在评测中打了第三方公司,谁赔——模型厂、评测方,还是没人?至今没有判例,而这决定各方愿意为容器多花多少钱。

四,反向风险。 如果实验室因为这次把评测收回自建,独立性反而更差。那才是真正的坏结局。

AI 安全的公开辩论一直围着「模型对不对齐」打转。这三周真正暴露出来的是:判定对齐的那套装置,本身还没被当成关键基础设施来建。