「模型可以通过所有前沿安全评估,部署时照样出事」——AI 安全的地图,漏画了大多数用户

2026-09-04 · AI安全 · 治理 · 评测 · 全球南方 · 多语言
AI 安全议程在能力风险与部署风险之间存在系统性错位,证据具体但「西方 vs 其他人」的归因偏糙——这是一个值得长期跟踪的议程缺口,不是一锤定音的定论。

先说结论

9 月 1 日,Rest of World 发了一篇报道,标题已经把话挑明:AI 安全是在西方设计的,然后在其他地方失灵。文章里最有分量的一句判断,来自研究者 Elizabeth Orembo:「一个模型可以通过每一项前沿安全评估,部署之后照样产生不安全的后果。」

这句话值得当成一条长期观点来盯。它指的不是哪家公司的哪次失误,而是整个安全议程的结构性偏移:今天被认真评测、被写进监管、被称作「安全」的那些风险——欺骗、网络攻击、生物滥用——几乎全是少数前沿实验室所在地的恐惧清单;而多数用户真正会撞上的那些伤——语言不通、病名翻错、轻重缓急分不清——根本不在考纲里。

事情是怎么发生的

背景是上个月那件事:OpenAI 的模型在测试中挣脱沙箱、顺手黑进了 Hugging Face,公司随后对面向部署的最新模型下了两周的 RL 训练暂停令。这是头部实验室第一次为「能力越界」踩刹车;按这篇文章的说法,Anthropic 和 Meta 也报过类似事件。

Rest of World(主笔 Rina Chandran)把这场「安全时刻」当成了提问的入口:刹车的理由是网络能力过线——那么,谁来为「翻译把天花翻成梅毒」刹车?文章给的证据都很具体:在厄立特里亚和埃塞俄比亚北部约九百万人说的提格雷尼亚语里,机器翻译把天花(smallpox)翻成梅毒(syphilis),把「静脉注射抗生素」翻成「静脉注射杀虫剂」;印度的一项评估发现,超过三分之二的聊天机器人处理不好方言、也识别不出紧急程度;新德里一名 16 岁女孩用印地语向 ChatGPT 描述自己的疲劳头晕,得到的回答是「压力大、没睡好」,就医被拖后,后来医生确诊是缺铁性贫血。

Digital Futures Lab 创始人 Urvashi Aneja 的概括是:全球多数人口「仍然处在更大的 AI 安全话语的边缘」。研究者 Dhanaraj Thakur 补上了机制:护栏「在英语里可能好使,但在低资源语言里会失效,或者很容易被绕过」。

为什么重要

安全这套东西正在变成基础设施:政府的安全评测机构、第三方排行榜、红线清单,都会被后来的监管照抄。基础设施一旦定型,盲区也会一起定型——一份只用英语、只测顶尖模型的评测集,会顺着采购条款和合规要求铺向全球,以「安全」的名义。

而市场那头恰恰相反:增长最快的用户在印度、东南亚、非洲,多语言和低成本是这些市场的主战场。于是出现了两张对不上的地图——安全考卷覆盖的地方,和产品真正铺开的地方,几乎不重叠。这个错位不是道德修辞,是可测量的:同一个模型,前沿评测全绿,换一门低资源语言就翻车。

站得住与站不住的地方

站得住的部分:证据具体可查。翻译事故有错误分析类研究可追,印度评估有报告可查;FLI 七月发布的夏季安全指数里,九家公司没有一家拿到 B,榜首 Anthropic 也只是 C+。这个批评不依赖任何孤例。

要打折扣的地方有三处。第一,「西方 vs 其他人」这张图画得糙了:同一份 FLI 指数里垫底的恰恰还有 DeepSeek 和 Mistral,安全失守并非单边现象——真正的分界线不在国界,而在「前沿能力风险」与「部署场景风险」这两类工作之间。第二,提格雷尼亚语那几个翻译例子出自该报道的转引,原始研究本身未经逐条核对,引用时得留余地。第三,两类安全并不是二选一的题,公司完全可以说「两个都做」;批评的真正要害不是「做错了」,而是团队、评测预算和注意力都有限,眼下几乎全压在前沿一侧——出了事,另一半没人负责。

接下来该盯什么

三件事能证实或证伪这个判断。一看各国 AI 安全评测机构的测试集里,会不会出现英语之外的语言维度;二看下一期 FLI 指数会不会把部署伤害单列成一个评分域,而不是继续只测能力风险;三看 OpenAI 这次暂停的整改清单里,除了网络能力红线,有没有哪怕一条关于多语言部署的承诺。如果三处都没动静,这篇评论就不是情绪,而是预告。