修图也能「多想几步」:ResFlow-Tuner 把大模型的推理时扩展搬进影像复原

🧠 大模型影像论文精读 · 2026-09-05 · Image Restoration · Diffusion · Test-Time Scaling · Flow Matching · Reward Model
arXiv 2026-03 · 真实场景图像复原的推理时扩展(test-time scaling)

有意思的不是又一个更大的修图模型,而是一笔账的搬家:大语言模型圈最流行的那句「答得好不好,可以用推理时的算力买」,被原样搬进了真实场景图像复原——同一个 120 亿参数的底座,多算十几倍,画质就肉眼可见地高一截。

https://arxiv.org/html/2603.22027v1/Figure_1.png

画质上限,在训练那天就锁死了

把网上压缩过的图、多年前的老照片、一放大就糊的截图修回干净细节,这几年已经全面转向生成式路线:与其在像素上做回归(那样容易得到一张什么都对但什么都不锐的「平均值」图),不如让文生图大模型直接「想」出高清版本。但这条路线有个先天别扭之处:模型的质量上限在训练结束那天就定死了,上线之后想更好,只能回去重训。

更麻烦的是运气。扩散类模型修图的方式,是一步步从纯噪声走到成图,这条去噪路径本质上是随机的——同一张废片走不同的路径,编出来的发丝、标牌文字、皮肤纹理可能对,也可能错。而常规做法是采样一次、出什么算什么,一条路走到黑。

关键转折:给去噪路径请一位考官

ResFlow-Tuner 借来的概念叫「推理时扩展」(test-time scaling):大语言模型做难题时不再一口气写答案,而是铺开多个候选,让打分器挑出最好的继续往下想。这篇论文把同一套流程装进了 120 亿参数的文生图底座 FLUX——一个流匹配模型(可以理解为扩散模型的近亲,学的是从噪声指向图像的「方向场」),让随机的去噪路径变成一场有考官在场的选拔。

循环是四拍:在去噪中途注入一点噪声,把路径扰动出七个候选;每个候选往前抢算几步、粗略预览成片;交给三位「考官」打分——美学评分器管好不好看、图文对齐分管内容对不对得上、人类偏好模型管大家更爱看哪张——只留下最好的几个,继续下一段去噪。如此四轮,画面的走向就在考官的注视下被逐步拧向高分区。

https://arxiv.org/html/2603.22027v1/Figure_2.png

值得注意的还有适配的便宜:底座全部冻结,只训练一枚 LoRA(挂在大模型旁边的一小块旁路参数)把低清图接进去,约占整体参数的 0.5%;连文字条件都是现成的——一个视觉语言模型先看一遍粗修结果,自动写出详细描述,再交给底座。

效果上,论文在多个基准的无参考画质指标(不拿原图对比、直接给成图打分的自动指标)上全面领先,其中在真实照片测试集上拉开了断崖式差距;人工盲评也在八成图上被选为最好的一张;在真实模糊文字的场景里,识别召回率从约 7.5% 拉到近 50%。

这笔账会怎么进入真实工作流

对行业而言,这件事把「修图质量」从研发变量变成了产品变量。云端修图可以像云计算一样分档:「标准修复」和「精细修复」用同一个模型,差的是算力钱,不再需要维护两套模型。档案、票据、监控这类以「字能不能认出来」为目标的场景直接受益。而对做画质评测的人,这是一记警钟:这类方法会精准讨好无参考指标,以后「指标涨了」和「真的更好」之间的距离只会越拉越远。

代价也明摆着:默认配置约等于单次采样 15 倍的推理开销,继续加码收益递减——手机端无缘,落点在云端。更值得警惕的是考官本身:三位考官偏什么,画面就长成什么样。大模型圈一个已被反复观察的现象是,人类偏好模型普遍偏爱饱和、锐利、「网感」强的图——这套系统等于把这种偏好放大再放大;论文也承认,按像素误差算,它反而输给老式 GAN 复原方法(用对抗训练换锐利度的上一代路线)。「多想几步」想得对不对,取决于考官准不准——这道题,大语言模型圈自己也还没答完。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读