视频生成模型的画面已经好到难以挑剔,但让它拍「重的球和轻的球同时从斜坡滚下」,它多半会让其中一个先到——而物理定律说这不对。arXiv 2026-09 的 Principia 做的事,是把「生成的视频守不守物理」从一句吐槽变成一个分数:六个主流模型在画质榜 VBench(常用的视频生成自动评测,主要给画质、时序稳定性这类「好不好看」打分)上清一色 0.8 上下,在它的物理考试里最高只拿 0.419。

为什么物理一直测不了
直觉做法是算速度、加速度,跟真值比。但生成视频没有真值,更根本的障碍是:从画面推绝对速度,必须知道帧率、物体的真实尺寸、相机的焦距和位置——这些在一段凭空生成的视频里统统不存在。所以现有评测都绕开了物理,默认「画质好了,物理自然对」。
关键转折:不问绝对量,只问关系
Principia 的做法是给每个场景放两个物体,让它们服从同一条物理定律——那么两者运动之间必然存在可预言的关系:两个不同质量的滑块从对称斜坡同时释放,若摩擦定律成立就该同时到底;两个摆长不同的摆,周期之比必须等于摆长平方根。这些关系全是等式、比例和次序,与帧率、尺度、相机参数完全无关,在像素空间里就能验证。

考题全部实拍:八种现象(重力、摩擦、碰撞反弹、转动惯量、抛体、动量、单摆、弹簧振子),装置严格受控——配对物体的质量、高度、半径匹配在 5% 以内,用机械导轨同步释放。评测时用 SAM3(一个按提示分割并跟踪物体的视觉模型)把两个物体逐帧抠出来,从像素轨迹上量出反弹高度、到达时间、振荡周期,代入公式打分:关系完全成立得 1 分,偏差越大越接近 0。
成绩单:画质与物理几乎是两回事
最扎眼的对比:开源的 Wan2.2-14B 物理分 0.419 排第一,闭源的 Veo-3.1 只有 0.379,而 VBench 都在 0.8 附近——视觉质量和物理保真在这批模型里近乎正交。更细的裂缝还有两道。扩参数不救命:Wan 从 5B 扩到 14B,摩擦分涨了 0.40,动量反而掉了 0.05;动量是全场最难的题,六个模型最好成绩只有 0.074。让视觉语言模型当裁判看视频找物理错误,最好的只对 67%——二选一的题瞎猜是 50%,而且换更大的模型不升反降。
这会进入哪些真实工作流
影视预演用生成视频做分镜,画面好看但物体穿帮,导演没法判断调度;机器人和自动驾驶开始拿生成视频补训练数据,物理不成立的视频等于在教模型一个错误的世界;世界模型赛道宣称「学到了物理直觉」,同样需要一张不奖励好看的成绩单。Principia 给出的是一套便宜的自洽性核对思路:不要求重建真值,只要求模型自己不矛盾。这种「标定无关」的评测设计,往后大概率会被搬去测流体、软体乃至光照一致性。
局限与存疑
它只覆盖宏观牛顿力学,流体、软体、热都进不来;「关系成立」是物理正确的必要条件而非充分条件——模型可能碰巧让两个滑块同时到底,别处照样穿帮;原实拍视频为防刷榜不公开,只发首帧和提示词,第三方复现分数有门槛。另外这套体检本身不便宜:论文花了约 2600 个 A100 GPU 小时生成待测视频。但它至少把一个长期停留在直觉上的问题变成了可量化的数字——在视频生成从「好看」走向「可用」的路上,这种考试会比画质榜更早决定哪些模型能被信任。