这份基准有意思的地方在于:它没提出任何新模型,而是把一个各家都在赌的问题——「AI 修复到底该塞进相机流水线的哪一端」——变成一个控制变量的实验,然后给出一个不太符合直觉的答案:位置本身不背锅。
先说清楚背景。手机按下快门时,传感器吐出的原始数据(RAW)还不是照片,中间要经过一条「电子冲洗流水线」——ISP(Image Signal Processor,图像信号处理器):先去马赛克把每个像素补齐成红绿蓝三色,再做白平衡和色彩校正,最后做色调映射、把宽容度压进一张普通照片里。每个厂商这条流水线的配方都是私有的。现在大家都想往里加 AI 修复(降噪、去模糊),装在哪一端是个真实的工程分歧:一派主张放流水线之前的 RAW 端——退化还没被流水线「搅」过,物理上最干净,理论最好修;另一派放在成片(sRGB)端——数据和现成模型都多,还能当作 app 层功能事后加装。直觉站在 RAW 派一边。但以往的比较有个毛病:修复在哪个域、用什么数据训练、经过哪条流水线、怎么评测,全混在一起,RAW 派赢了也说不清是位置的功劳还是数据的功劳。
这篇论文(Würzburg 大学,BMVC 2026)的做法就是把变量拆开:ISP 全程冻结成黑盒——权重不动、不给梯度,模拟真实的私有流水线——然后只动两件事:修复模型放在哪一端;训练时见没见过这条流水线的输出。规模不大但控制得干净:四组手机传感器(Vivo X90、Google Pixel、Samsung S9、iPhone XS)、两个学习型 ISP、三档退化(只噪、只糊、又噪又糊),凑出一个 2×2 的对照。
结果分两层。RAW 端修复确实能打赢「通用」RGB 修复模型——那些在公开数据上训练、没见过目标相机的 all-in-one 修复模型,直觉没全错。但全场赢家是:放在成片端、却在训练时见过目标 ISP 输出的那个模型,整体成绩最好;实拍对比里它也压过了 Real-ESRGAN 这类通用增强模型,后者在这批样张上把纹理磨平了。为什么会「位置差、数据对」反而赢?因为 ISP 不是透明管道:色调映射是非线性的,会放大暗部噪声、把退化形态整个改写。见过这条流水线输出的模型,等于直接学会了「这台相机是怎么弄坏图的」;而 RAW 端模型修得再干净,出门还要再挨一遍 ISP 的非线性折腾。
这个结论往几个真实方向都能落。对手机厂商,与其继续赌「专用 AI-ISP 芯片放 RAW 端」还是「应用层增强放成片端」,不如先保证修复模型见过自家流水线的输出分布——位置是次要变量,对齐才是主要变量。对第三方修图 app 反而是利好:你只拿得到成片,但只要能拿到目标机型的成片分布来适配,成片端就是信息最全的位置。对做 benchmark 和写论文的人,作者的建议很直接:修复工作必须报告「放哪一端」和「是否用目标流水线输出训练」,否则 RAW 对 RGB 的比较没有归因价值。顺带一提,通用生成式修复在实拍上过度平滑的那组例子,也提醒了一件事:把「会编细节」的模型直接接进拍摄流水线,风险是真实存在的。
局限作者自己列得很老实:退化是合成的,测试集只有 47 张图;通用模型的对比也没有做训练量对齐。更关键的是,他们还没试「把流水线的行为近似塞进 RAW 端修复的训练目标里」——如果 RAW 模型也能见到 ISP 的脾气,排名可能再翻回来。所以正确的读法不是「成片端更强」,而是:在位置吵出结果之前,先把训练分布对齐了。
