这篇论文有意思的地方不是「又做了一个修图评测集」,而是它把一个我们做色彩的人很熟悉的麻烦,第一次摆到了生成模型的台面上:当你让 AI 把房间里的灯打开,它不只是加了光,它还顺手把整张照片的白平衡和曝光改了。而现有评测统统被这一下带偏。

背景:评生成图像的「光」,一直是靠感觉
现在评修图模型的光照是否合理,主流有两条路:一是拿 PSNR / SSIM / LPIPS 去比像素,二是干脆请视觉大模型或人来打分「像不像真的」。前者的真值多半来自合成渲染或者 light stage 里的单个物体,后者只能给出宏观的观感判断。作者点出的第一个坑很扎心:在他们的数据上,一个什么都不做(根本没把灯打开)的假模型,用 PSNR / SSIM / LPIPS 去评经常排在前列——因为它至少没引入任何伪影。
转折:把不该被测的自由度,从公式里解析地消掉
作者的做法是笨功夫加聪明度量。笨功夫是数据:Sony α6600、14-bit、每张图两组 9 档包围曝光,堆栈降噪后合成 HDR,再按 EXIF 校正畸变和暗角,存成线性数据,光圈固定 f/8、对焦固定约 1.5 米,一对图要拍五分钟,一共拍了 1000 对室内「灯开 / 灯关」,并人工标注了投影、高光、金属、镜面、透明这些难区域。
聪明的部分是度量。他们承认自己控制不了两件事:模型给的灯是什么色温和亮度(记作一个逐通道的缩放 $C$),以及模型对全图做的曝光 / 白平衡平移(记作 $K$)。既然控制不了,那就让度量对它们免疫——把「开灯 / 关灯」的比值图逐通道标准化,得到 SIE(标准化强度误差);再对比值图取空间梯度,常数项求导即消失,得到 LFE(低频误差)。两个量都在通道上独立计算,因此对任意材质和纹理都成立。附录里给出了对 $C$、$K$ 的不变性证明,并实测:把真值 HDR 整体往暖或往冷推一档,PSNR / SSIM / LPIPS 的排名会明显变化,SIE / LFE 纹丝不动。
结论也值得记:六个模型差距不小,Nano Banana Pro 总体最好;误差随光强衰减而系统性上升(按平方反比分成六个强度带看得很清楚);镜面场景模型间分化最大。最有意思的是第三方对照——用视觉大模型当裁判的 PICABench 把 GPT Image 1.5 排在第一,而 3DLP 把它排在最后;作者又用 Gemini 3.1 Pro 和 GPT-5.5 做真图 vs 生成图的二选一,部分模型的正确率低于 50%,也就是大模型宁愿选那张假的。宏观合理性它懂,像素级的光传播它不懂。
发散:这套思路能借到哪儿
对 ISP 和色彩这一侧,最直接可搬的不是数据集,是那个度量哲学:把你不想测的自由度先解析地商掉,再谈误差。评白平衡算法时我们习惯用角度误差把亮度商掉,本质是同一招;但评「重光照」「换光源」「多光源分区」这类任务时,业界还在用一堆对全局增益敏感的指标。同理,做多光源 AWB 的分区评估,完全可以借 SIE 的构造:先对每个通道标准化,再看空间结构对不对。
另一层价值是数据。1000 对线性 HDR、已知内参、每个视角五个灯位、还带材质标注,用来做逆向渲染、材质估计,或给「光源色度 × 场景反射」的纠缠问题做真实基准,都比合成渲染更有说服力。
局限与存疑
灯只有约 2500 流明,室外白天直接被压过去,所以整个基准限定在室内;光源几何做了消融但主基准只用球形灯泡,emission pattern 的复杂性被刻意回避了。更要紧的是,SIE / LFE 对全局白平衡免疫是优点也是盲点——它测的是光怎么传,不管颜色对不对。一个把整屋子渲成偏黄的模型,只要空间分布对,照样得高分。真要评色彩还原,还得再叠一层带色度约束的度量,而这一层论文没有给。