这篇论文有意思的地方,不在于又造了一个更强的复原网络,而在于把「给整张图选一种修法」拆成了「给每个像素选一种修法」。
问题:一个模型包治百病,但药方只有一张
拍照时的污损从来不是单选题。雨、雾、噪点、运动模糊常常混在一张照片里,而且分布不均——天空雾重、路面雨丝密、暗处噪点凶。图像复原领域这几年的主流做法叫「全一复原」(all-in-one restoration):训练一个模型同时对付多种退化,省得每种病单开一个模型。
难点在于模型得先知道「这张图得的什么病」,再决定怎么治。上一代方案的办法是给模型「提示」:要么配一组可学习的提示向量,代表各任务的路子(PromptIR 这条线);要么让人写一句话告诉它「把雨去掉」(InstructIR 这条线)。这些方法确实让一个模型顶了好几个,但它们共享一个盲区:提示是整张图一份的。模型判定主病是雾,整图就按雾的方子治,雨丝密集的角落和噪点严重的暗部只能跟着吃同一副药。
转折:提示从一份变成几十万份
这篇叫 MGN-AIR 的工作把提示的粒度打到了像素级,分三步。
第一步,让模型自己画一张「病灶图」:一张与原图同尺寸的数值图,每个像素存一个数,表示这里的退化有多重。关键在于这张图不需要人工标注——训练数据本来就是「退化图 / 干净图」成对给的,两者的逐像素差异就是免费的监督信号,模型照着这个差异学会预测。
第二步,把一句话描述(比如「带雨线的雨退化」)经 CLIP——一个把文字和图像编进同一空间的模型——压成一个全局向量,与病灶图逐像素相乘。文字负责说「是什么病」,病灶图负责说「哪里病得重」,两者相乘,得到每个像素自己的「处理配方」。
第三步,网络按配方分区干活:退化重的像素走卷积分支,擅长局部强修;退化轻的像素走窗口注意力分支,擅长保住细节。一张图里,强修和轻修同时发生。

在混装去雨、去雾、去噪、去模糊、去雪、低光增强的标准基准上,它比此前的全一方案普遍高出约 1.5 到 2.3 dB PSNR(dB 是复原质量的常用尺子,越高越接近原图),小版本单张约 36 毫秒。论文刚被 ACM MM 2026 接收为口头报告。
它可能先落进哪些工作流
手机端的多病同治。 夜景照片往往同时有噪声、高光溢出和涂抹感,按区域配方的复原比整图一个滤镜更符合物理;36 毫秒的单张耗时,离实时预览只差最后一段压缩。
相册一键修复。 老照片的划痕是局部的、褪色是全局的,模型顺手画出的病灶图本身就是一份现成的「修复力度蒙版」,可以直接暴露成用户可调的笔刷初始值。
监控与自动驾驶。 挡风玻璃上的局部水珠、随距离加重的雾,正是空间非均匀退化的常态,全局策略在这类场景天然吃亏。
它也提了个评测上的醒:全一复原今后可能得按区域报指标,整图平均分会把「局部修得好」抹平。
局限与存疑
病灶图的监督来自「退化与干净的逐像素差」,对雨丝、雾这类结构性退化很直观,但对随机噪声并不成立——噪点重的像素差不一定大,作者也承认去噪仍略输专门模型。文本这一半只用了全局一句话,「带雨线的雨」这种细节并没有真的落到像素上。36 毫秒是服务器级 GPU 的成绩,塞进手机还得再砍;而基准里的混合退化终究是合成的,真实夜景那种「噪声 + 压缩伪影 + 涂抹」纠缠在一起的退化还没被验证。
