AI 的三倍提效,是不是机器多上了两班?Tunguz 问对了账,却算错了良率
先说结论
AI 让一个人干出三个人的活,究竟是效率提高了,还是背后多了两班机器?9 月 8 日,Theory Ventures 投资人 Tomasz Tunguz 用这个问题,重新解释软件业的提效叙事:开发可能正在变成需要持续投入算力的生产活动。他的原文值得读,也值得反驳。
他提醒大家把计算资源记进账本,这点很有力。但把机器运行时间当产出、把人工介入当废品,同样会算错账。关键不是人有没有变聪明,而是交付同样质量的成果,究竟花了多少总资源。
事情是怎么发生的
起点是 OpenAI 9 月 6 日发布的内部研究加速报告。公司称,到八月中旬,研究组织的智能体总运行时间,按八小时折算,达到每个人类工作日对应 3.1 个智能体工作日。
Tunguz 把它比作工厂轮班:人下班了,机器继续做。他进一步判断,软件开发的竞争会越来越依赖计算投入。
但原始数字统计的是运行时间,不是验收产出。它也没有证明这些时间都发生在夜间;并行启动多个智能体,同样能累积工时。工厂比喻解释了一种可能的组织变化,却不能替代生产率测量。
为什么重要
这里有一个常被忽略的分母。公司谈“人均产出”,只除以员工人数;但使用 AI 后,背后可能增加了推理、调度、审查和返工投入。人均产出可以提高,单位成果的总成本却未必下降。
这不是说花钱买加速没有价值。假设一家企业提前完成产品测试,即使成本更高,也可能获得更大的商业回报。反过来,便宜地生成一堆没人采用的代码,并不等于创造价值。
因此,行业需要同时看速度、质量和总成本。只盯员工数量,容易把预算优势解释成人才效率;只盯算力账单,又容易漏掉缩短交付周期的价值。这是从 Tunguz 的判断延伸出来的管理问题,而非这份报告已经证明的行业结论。
站得住与站不住的地方
Tunguz 最需要修正的,是“良率”。OpenAI 说的是:过去六个月,估计人类需四至八小时完成的任务中,成功案例有超过一半经历过人工干预。Tunguz 却进一步用约五成的自主良率估算交付量。这一步站不住:人工澄清要求、提供信息或纠正方向,都不等于任务报废。成功样本里的干预比例,也不能拿来推算全部任务的失败率。两者的口径差别就在原报告中。
成本也要留一层边界:报告按 API 价格折算使用量,不是公布内部实际支付的账单。可以据此看资源使用强度,却不能直接认定公司的真实支出。
同样,替 OpenAI 把数字解释成三倍科研进步也不成立。公司自己就提醒,整体研究进展未必跟得上这些局部指标。局部活动更密集,距离最终成果更有价值,中间还有一段路。
接下来该盯什么
下一份提效报告,最该补上的是:固定质量标准下,完成了多少被采用的成果,消耗多少计算资源,人类总共投入多少时间。
如果投入增加,可靠交付增长得更快,机器多上两班当然值得。如果只是运行更久、生成更多、审查更忙,工时曲线再陡,也不能替成果说话。
Tunguz 留下的好问题,是软件业的成本结构会不会改变。真正能回答它的,不是机器忙不忙,而是每多花一份资源,究竟多交付了什么。