测一个模型,正在变得比让它干活还贵——从鹈鹕骑车到 5500 行的中土世界

2026-08-05 · AI观点雷达 · 评测 · Karpathy · 影像系统
生成一件复杂作品的成本塌到了 10 美元,给它打分的成本却涨到了「得有人走进墙里才知道哪儿坏了」——整个行业一直在给生成端做预算,没人给评估端做预算。

先说结论

8 月 2 日 Karpathy 那条帖子被大量转发,转发语大多是「模型又变强了」。我认为这是读偏了。真正变了的不是模型强度,是测试的单位

过去两年测一个新模型,最顺手的一招是 Simon Willison 那个「画一只骑自行车的鹈鹕(SVG)」——它好用是因为它便宜:生成一秒,打分也一秒,眼睛一扫就知道成没成。现在这道题失效了,而接替它的那类任务,生成端只要 10 美元,评分端却没有对应的便宜办法。**生成成本在坍塌,评估成本在爆炸。**这才是这周值得记下来的事。

事情是怎么发生的

Karpathy 在 X 上写:「We’re starting to leave the territory where you’d test an LLM by e.g. “create an svg of pelican on a bicycle”」——我们开始离开那个用「画只骑车鹈鹕」就能测模型的地带了。

他做的替代实验是:把《魔戒》开篇第一段丢给 Opus 5,给一个 100 万 token 的预算(约 10 美元),要求用 three.js 把这段文字渲染出来。模型跑了大约两个小时,写出 5500 行代码,程序化地把这段故事渲成了一个可以在浏览器里走进去的三维场景。他自己评价是「janky but fun」——挺糙,但好玩。源码他放在 karpathy.ai/lotr-movie/,可以直接打开。

帖子里更值得注意的是他顺手记下的那个短板:模型没法轻松审自己的活,因为它「没法高效地、原生地感知视频,或者在这些世界里自己玩一遍」(原文片段:efficiently and natively perceive videos or play games within them)。Opus 5 的做法是笨办法——在若干位置慢慢截屏来看自己渲成什么样,中间搞砸了几次,糙也就糙在这儿。

顺带说一下鹈鹕那道题的死法。有第三方博客(Playcode)用同一套 harness 跑了 13 个模型,说每个都第一次就画对了。这是单次自媒体实验,我只当旁证;我也没查到 Willison 本人宣布过这题作废——别把话安在他头上。

为什么重要

把两件事并排放:

生成侧,一个「没人会专门去做」的定制品——五千行的中土世界——现在是 10 美元、两小时、无人值守。Karpathy 点出的转折是:从「谁会花这个时间」变成「那就做呗,反正约等于免费」。模型的耐力无限,这一条正在把「值得做的东西」的边界整体外推。

评估侧,SVG 有肉眼可判的 ground truth,一秒钟;可交互的世界没有。有人回帖说得很准:你得真的走进一堵墙、或者打开一次菜单,才知道状态机在哪儿断了。这类缺陷没有闭式判据、没有单一标量,也不能靠采样几帧覆盖。评估复杂度随产物的状态空间涨,生成复杂度只随 token 预算涨——后者在变便宜,前者没有。

Karpathy 讲的「模型看不见自己渲的东西」只是这件事的一个特例。即使换一个能看视频的模型,问题也只是从「模型不会判」挪到「谁来判、按什么判」——这是度量学问题,不是感知模块问题。

我的正反评价

**站得住的部分。**一手信号、作者本人发布、实验可复现(源码与成本都公开),而且它把负面观察写进了同一条帖子,而不是只晒成功截图——这在当下的 demo 文化里是稀缺品质。它指认的不对称也确实在发生:这一年被淘汰的评测题都是「打分便宜」的,新提出的评测都是「打分昂贵」的。

**要打折的部分。**一,n=1 的轶事,不是评测。「janky」承担了太多信息量却没量化——糙到什么程度?哪些是渲染错误,哪些是叙事偏离?二,「离开鹈鹕的地带」这个判断目前主要靠观感。三,也是我最保留的:一个好看的可玩场景,跟真正想测的能力(长程规划、库的正确使用、状态一致性)之间是什么映射关系,帖子没交代——很容易滑向「看起来酷 = 能力强」,那恰恰是这条帖子自己在批评的东西。

对研究、教学和影像系统的启发

**对研究。**这条不对称在颜色和 ISP 里存在很多年了,只是我们没这么叫它。ΔE 统治评价,一半原因是它便宜、可微、能进 loss;代价是凡 ΔE 看不见的失效,整个领域就集体看不见——同色异谱上 ΔE 恒为零,是最刺眼的一例。Karpathy 遇到的是同一件事的另一头:产物复杂到没有廉价判据时,人就退回到「截几张图看看」。下一步该投的不是更强的生成,而是能廉价执行、又确实指向失效机制的判据。谁把评估成本打下来,谁就重新定义了这个方向能优化什么。

对影像系统。「定制化约等于免费」直接可用:per-sensor 的标定脚本、per-scene 的 pipeline 变体、每颗模组一套的诊断可视化,过去因人力不划算而被统一处理的东西现在可以逐个生成。但同一条也是风险:一百套定制 pipeline 意味着一百套要验的东西,而验证没变便宜。别在拿到自动判据之前扩张定制化规模。

**对教学。**这个案例可以直接进课堂:给学生看那个能走进去的中土世界,只问一句「你怎么判断它做得好不好」。大多数人会卡在这儿——他们会亲身体验到「我看得见它坏了,但说不出坏在哪、也没法批量测」。这就是度量的入口,比讲十遍「要设计评价指标」都管用。