修图不需要先会画画:PixRestore 把扩散从潜空间搬回像素

🧠 大模型影像论文精读 · 2026-09-04 · Image Restoration · Diffusion · Pixel Space · Unified Model
arXiv 2026-08 · 统一图像复原:一个模型同时处理八种退化,主张复原不必依赖文生图生成先验

这两年修图模型的主流做法,是把文生图大模型改造成修图器:Stable Diffusion、FLUX 这类模型在海量好图上学会了「世界大概长什么样」,让它们看着一张模糊照片去「画」出高清版,效果往往比传统算法更讨喜。香港理工大学与 OPPO 研究院的这项工作(PixRestore)把这条路反着走了一遍:不用文生图预训练、不进潜空间,直接在像素上从头训练一个约 50M 参数的复原模型,一步出图,一个模型同时对付八种退化。

先看老路卡在哪。文生图修图器进门要先过一道 VAE——一个有损压缩器,把整张图压成一个小得多的「潜表示」,生成完再解压回来。对凭空画图,这一步无伤大雅;对复原却是要害,因为复原要找回的恰恰是压缩时丢掉的东西:小字笔画、细边缘、发丝。作者做过一组干净对照:同一个骨干网络,走潜空间与直接在像素上做,八项任务平均相差 3.8 dB——虽然单项差距从不到 1 dB 到约 10 dB 不等,但均值这个量级,通常要换一代方法才追得回来。更深一层的问题是生成先验的「主见」:模型会补上它认为「应该有」的内容,与真实场景对不上——你请它修模糊的招牌,它可能顺手换一块更好看的。

PixRestore 的第一个转折,是把扩散(从一团随机噪声出发、一步步「推」成目标图像的生成方式)直接建在像素上。担心像素当「词」太多,它把图像切成 8×8 的小块、每块当一个词——和视觉 Transformer 处理图像是同一思路。代价是无法再借文生图模型的权重,一切从头训。那么对「好图像长什么样」的常识从哪来?作者换了一个来源:DINOv2,一个自监督训练出来的通用视觉编码器——只在图上学习,不负责生成。它从低质图里逐层抽取特征,而 PixRestore 的关键设计是逐层判断「这一层的特征还靠不靠谱」:把低质图与高清图在同一层的特征做比对,相似度高,说明这层信息没被退化毁掉,直接当条件喂给复原网络;相似度低,说明这层已被污染,改为加大真值监督的力度。复原网络由此知道哪里可信、哪里必须靠学到的知识补。

工程上还剩一个「慢」。PixRestore 把多步生成过程蒸馏成单步:直接从噪声一步走到干净图像;单步生成容易把纹理抹平,于是再加一个判别器兜底——判别器的「眼睛」也复用冻结的 DINOv2,每层装一个真/假分类头。结果是:总参数约 54M(含冻结编码器),在服务器 GPU 上一步 44 毫秒一张;作为对照,基于 SDXL 的统一复原模型 FoundIR-v2 约需 18 秒,基于 FLUX 的对手也要 1–6 秒。作者报告在八类退化上多数指标排前二,真实退化测试集上小幅领先最强对手。

https://raw.githubusercontent.com/csslc/PixRestore/main/figs/framework.jpg

这组数字对产品端有直接含义。修图 App 里的「画质修复」目前大多要在云端排队跑十几秒;一步、50M 量级、多任务通吃,是「统一复原」第一次长得像能塞进端侧 NPU 的形态——去噪、放大、去雾可以并成同一个按钮。对行业,它的含义更尖锐:如果复原确实不需要生成先验,中小团队就不必绑定 SD/FLUX 的版权重与大显存,「自监督视觉底座+配对数据」是一条可以自研的路线,对相机厂商尤其如此。另外,一步模型逐帧跑视频时随机性更小、时序闪烁理应更可控,这条值得视频复原的下游去验证。

存疑处也不少。八类退化——模糊、雾、雨、雪、噪声、低光、雨滴、放大——都还是教科书式退化,真实手机链路里「压缩伪影+低光+ISP 处理」的复合退化覆盖有限。头名优势其实很薄:真实测试集平均分 67.88 对 67.55(且这个第一出自 210M 的加大版,不是前文那个 50M 小模型),真正的优势在效率,不在质量断层。「从头训」也别读成「无先验」:DINOv2 本身见过上亿张图,先验只是从生成模型换成了判别式模型;训练动用约 283 万张配对图、8 张 A800 跑数十万步,省下的是部署成本,不是训练成本。最后,像素「词」数随分辨率平方增长,是所有像素空间方案共同的税——512 分辨率训练的模型上到 4K 场景表现如何,还有待第三方实测。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读