有意思的不是又一个更强的修复模型,而是把「AI 修复该插在相机流水线哪一环」这场口水仗,变成了能裁决的受控实验——答案还反直觉。
先说这道题本身。 手机拍出的照片并不是传感器「看到」的样子。传感器吐出的 RAW(原始读数,可以理解成光的生肉)要经过一段固定流水线才变成相册里的照片,这段流水线就是 ISP(图像信号处理器):把单色马赛克读数插值成全彩、做白平衡和色彩校正、再压缩动态范围。夜景手持的噪点模糊如今都指望 AI 修复收拾,于是有个绕不开的问题:装在 ISP 前面修 RAW(趁退化还没被非线性加工搅浑),还是装在后面修成品图(训练数据好找,网上全是成片)?麻烦在于,现有比较大多把「放哪」「用什么数据训」「在什么流水线上测」搅在一起,赢了是域的功劳还是对齐的功劳,说不清;而真实手机的 ISP 是厂商机密,拿不到参数、不可微,模型没法跟它联合训练。
这篇基准的关键转折,是把变量拆开。 作者(维尔茨堡大学 Timofte 组,长期组织图像修复挑战赛)用两个公开比赛的获奖学习型 ISP——用神经网络模仿整条相机流水线的模型——当替身,训好后全程冻结成黑盒,然后只挪修复模型:插在 ISP 前修 RAW,或插在后面修 sRGB。再加第二根轴:训练数据是「通用」的(现成公开退化数据),还是「ISP-aware」的(用这台 ISP 的输出造训练对,但不碰它的参数和梯度)。两根轴交叉,铺开四款手机、三种退化(噪、糊、又噪又糊)。RAW 端用百万参数级小模型,RGB 端搬来体积大十倍以上的通用预训练修复模型(MiOIR 这类什么退化都能修的 all-in-one 网络)。
结果分三层。 第一层,通用大模型空降失败:三星 S9 去模糊上,RAW 端小模型(NAFNet 这类高效卷积网络的缩减版)拿到 25.99 dB,通用模型只有 22.49 dB——PSNR 差 3.5 dB,误差能量不到对手一半,肉眼能分出档次。第二层,RAW 先修确实能把 ISP「护住」:Vivo X90 上,又噪又糊的输入把 ISP 输出从 22.60 dB 拖到 19.37 dB,先修 RAW 拉回 22.00 dB,几乎追平干净输入。第三层是真正的反转:让 RGB 后修模型「见过」这台 ISP 的输出分布再训练(依然黑盒),它在三种退化上全部反超 RAW 前置;而把 RAW 模型换成本机传感器数据训练,提升微乎其微。胜负手不是 RAW 还是 RGB,而是训练分布有没有对准模型插入的位置。
真机也一样。Vivo X90 夜拍,ISP-aware 的 RGB 修复降噪同时保住细节;生成式修复的代表 RealESRGAN 却把纹理抹平了——把「会编细节」的生成式模型塞进相机流水线,是要付代价的。



往真实工作流上想。 对手机和影像芯片团队,启示是先回答「模型插在哪一环、训练数据从哪条流水线来」,再决定要不要把通用修复大模型塞进手机。它还给了一条可复制路径:拿不到厂商 ISP 参数没关系,用目标相机的输出分布造训练对就够。作者也建议,论文以后必须报告「修复位置」和「是否 ISP-aware」,否则 RAW 与 RGB 根本不可比。这也是对「通用基座」叙事的提醒:榜单上越强的 all-in-one 修复模型,越让人以为能即插即用,可一旦插进真实流水线,分布错位就是第一杀手。
局限也得分清。 测试集只有 47 张图、退化是合成的,学习型 ISP 只是替身,真实厂商流水线更复杂还会随光线变化;通用模型的对比并非训练匹配,「RAW 赢了通用模型」要打折看,真正硬的是「对齐比位置重要」这个受控反转。作者也留了个口子:若 RAW 修复能感知下游的色彩校正和 ISP,排名可能再洗牌——这篇刻意没做。
