超分的死结从来不是「放大」,而是放大之后补什么:补得保守,图是真的但糊;补得激进,图看着清楚,细节却是编的。arXiv 2608.30782 的 PixelIR 不再调损失权重,而是把这两件事拆给两个模型——一条流只管「修得对」,一条流只管「编得美」,输出时一加完事。
保真和好看,为什么天生打架
真实世界超分处理的是手机实拍那种低清图:有噪点、有压缩伪影,放大四倍后细节必须靠模型补。一种做法以逐像素误差为目标,输出趋向所有可能答案的「平均值」,纹理被抹平——指标好看,图发糊;另一种靠扩散模型(从纯噪声一步步去噪成图的生成模型)编纹理,看着过瘾,编出来的发丝却未必是真的。理论早就给过判决:感知质量与保真度无法同时最大化。把两个目标塞进同一个网络,怎么调权重都只是在这条取舍曲线上换座位,出不了圈。近一年流行的「一步超分」——把多步扩散模型蒸馏成一步出图——解决了速度,却没碰这个老矛盾。
转折:一个模型修对,一个模型编美
PixelIR 的做法近乎朴素:既然合不来,就别放在一起训练。这里的「流」指流匹配(flow matching):把「从起点到目标图」看成一条可学的直线路径,模型学这条路上每一步该怎么走,走几步就能到达终点。
- 图像流只管修对:从低清图直接推到一张底图,用逐像素、感知、特征三种相似度共同约束,训练完即冻结——它的目标函数里没有「编」这个字。
- 残差流只管编细节:它生成的不是整张图,而是「真值减底图」剩下的那层高频残差。从纯噪声出发、以冻住的底图为条件,再用对抗损失逼它把纹理编得像真的。
- 两者相加即输出。关键在「冻结」二字:底图是常数,残差流再放飞,也带不偏已经修对的结构。所谓两个目标互不干扰,在这里是字面意义成立的。
然后是把成本打下来。老师是两个模型、八步推理、3.7 亿参数;学生用金字塔结构一步出图,压到 3290 万参数——在 RTX PRO 6000 上,一张 512 分辨率图 8.5 毫秒。蒸馏时学生除了向老师对齐,还被同时锚定在真值上,否则学生的天花板就是老师的错误。一个耐人寻味的消融:去掉真值锚点后,无参考评分反而上涨,但那是纹理对不上真值的假高分。
结果:在 RealSR 与 DRealSR 两个真实超分基准上,这个一步小模型在同类一步方法里同时拿下 PSNR、SSIM、LPIPS 三项第一。「同时」是重点——这类模型过去通常只能占其中一两项。

能进哪些真实工作流
- 相册与端侧增强:3290 万参数、一步推理,本来就是按可部署规模设计的量级;8.5 毫秒目前是服务器级 GPU 的成绩,但这个体量落在手机 NPU 上属于够得着的范围。
- 细节强度滑杆:底图与残差是两个可分开调的量,把残差乘个系数再相加,就是修图软件里「细节强度」滑杆的雏形。论文没做这一步,但结构上是免费的。
- 细节层可插拔:作者把残差流换成 13 亿参数的文生图先验(PixelIR-L 变体)依然成立,意味着「编什么风格的细节」可以换模块——同一张底图配不同细节层,能得到不同质感的输出。
- 这套「结构修复+纹理合成」的分工,也能直接搬去去噪、老照片修复、压缩伪影去除这类同样可拆成两步的复原任务。
局限与存疑
两条流不是免费午餐:省下的只是部署端成本,训练侧的参数与步数反而更多。「残差是编的」这件事也没有消失——发丝、栅栏这类重复纹理该如何对齐,依然没有真值可依。论文没有失败案例章节,且在部分无参考指标上落后于对手,作者归因于纹理量不足;横向比较的延迟数字出自各家论文、硬件不一,作者自己也提醒了这一点。
超分领域每年产出数百篇论文,多数在同一套框架里换骨干、换损失。PixelIR 的价值不在刷点,而在把「保真与感知互斥」这条老规律改写成可直接执行的工程分工:一个模型修对,一个模型编美,冻结前者,二者就拆不了台。
