「零成功率」不是重点——AI Mania 这篇刷屏文,真正指认的是「说真话的人先被清掉」

2026-07-30 · AI观点雷达 · 组织与决策 · AI落地 · 评估指标
这篇最不可信的是「0% 成功率」这个数字,最该当真的是它的机制——AI 项目失败的主因不在模型,而在组织内部的验证与说真话机制被激励结构压死了。

先说结论

7 月 18 日,技术顾问 Nik Suresh(博客名 Ludicity)发了一篇《AI Mania Is Eviscerating Global Decision-Making》,几小时冲上 Hacker News 首页。他抛出的数字极其扎眼:过去一年半,他和团队接触到的 AI 项目,成功率是 0%——不是「大多数失败」,是一个都没成。

我的判断分两半。那个 0% 你必须打折:它是一个咨询顾问的轶事统计,样本天生偏斜,无法核验。但他给出的机制值得长期跟踪——他真正指认的不是「AI 不行」,而是组织里说真话的成本被抬到没人肯付,于是烂建议无人反驳、评价指标退化成「花了多少钱在 AI 上」。这是把 AI 落地失败从技术问题,重新框定成度量与激励失效问题。这个 reframe 比那个数字值钱得多。

事情是怎么发生的

他的一手观察来自过去一年大约 300 场与从业者的一对一交流。核心那句原话是:「我们作为团队观察到的所有 AI 项目都在失败。每一个都是——一年半里我们看到 0% 的成功率。」

紧接着他自己给了一个重要限定:很多情况下「失败与 AI 本身无关」,而是「公司在跑软件项目这件事上烂得无可救药」。这句被大量转载忽略,恰恰是全文最诚实的一句。

机制部分有两条最锋利。一是他称之为「分布式的暗杀式治理」:领导者无法诚实表达自己对组织方向的判断,因为怕被清掉,于是集体沉默。二是 demo 的心智破坏力——他给一批态度本来冷淡的客户演示 Snowflake Cortex,明确提示了风险,客户当场就要买;他说这暴露了一股与工具真实效用无关的购买冲动。

指标退化的例子够黑:把「AI 花费」当考核指标,搞「token 排行榜,越高越好」,却压根不追踪工具到底有没有被用。Simon Willison 第二天转了这篇,说它「塞满了来自匿名信源的辛辣轶事」,并点出两例:一位从没用过 ChatGPT 的高管,为一家年营收 20 亿美元以上的机构制定了以 AI 为核心的技术战略;一个工程师为了在 token 排行榜上好看,把整个仓库用另一种语言重写了一遍。

为什么重要

因为它给的不只是吐槽,而是一个可以被独立检验的因果假设:当组织把「是否在用 AI」而不是「AI 有没有改善结果」设成考核对象时,指标一定会被博弈掉,而最先被牺牲的是内部的反驳能力。

也正因为是假设,就不能拿另一个弱证据给它背书。那个更出名的「95% 的 AI pilot 失败」,本身方法就被批评得很凶,关键数字近乎孤证、口径含糊,被到处引用时早已脱离原文语境。两个都弱的证据叠在一起,不等于一个强证据。 要验证他这套机制,得去找有对照、有明确成功定义的数据。

我的正反评价

站得住的:机制描述、指标退化的具体形态,以及「demo 说服力与真实效用脱钩」这个观察——跑过横向项目的人立刻能对上号。

站不住的是 0% 这个数字。一是选择性偏差——顾问被叫去的多半是已经出问题的公司,健康项目进不了他的样本;二是「成功」始终没有定义,而成功标准的宽窄足以让同一批项目的失败率从个位数翻到九成;三是 300 场交流是接触量,不是抽样,n=1 观察者、无对照。

还有一处我不同意:他把这套机制主要归给高管的懦弱与博弈。但同样的现象也可以由更朴素的原因产生——多数组织根本没有能力度量「这个 AI 改动到底有没有让结果变好」。缺尺子的时候,人只能改去量花了多少钱、发了多少 token。这不是勇气问题,是评测基础设施问题。 后者更可修,也更值得投人。

对研究、教学和影像系统的启发

「AI demo 是思维杀手」这句,在影像系统里几乎是字面意义上成立的。一张 cherry-picked 的效果图能让整个评审会掉头,而同一个模型在几百张多光源场景上的角度误差可能更差。我们这行早有解药——留出测试集、报均值/中位数/最差 25% 分位、跨相机跨光源交叉验证——但解药只在决策者要求看它的时候才起作用。所以真正该争的不是模型,是评审桌上摆的那张表。

于是横向合作和教学其实是同一条操作结论:先把验收对象写死,再谈方法。合作立项时,指标不能是「引入了 AI 模块」,得是「在这个固定测试集上 AE / ΔE 降多少、最差分位降到多少」;学生用大模型写代码禁不掉也不该禁,但考核得从「产出看起来对不对」搬到「能不能自己构造一个反例把它测崩」。能验证的那部分,才是真正拥有的部分。

这也跟本栏目之前聊过的 Karpathy 那句「能验证的才能被自动化」接上了:他讲的是自动化的上限,Suresh 这篇讲的是组织主动放弃验证之后会发生什么。前者是天花板,后者是自毁。