别再借文生图的地基:PixRestore 把万能修图搬回像素空间,一步出图

🧠 大模型影像论文精读 · 2026-09-04 · Diffusion · Image Restoration · Flow Matching · DiT · On-Device
arXiv 2026-08 · 统一图像复原(一个模型同时修多种退化)的像素空间一步扩散方案

这两年图像修复圈有个几乎不加怀疑的默认动作:要做一个「什么都能修」的模型,就拿一个文生图扩散大模型当地基。PixRestore 把这个地基拆了。

https://raw.githubusercontent.com/csslc/PixRestore/main/figs/fig1-new.jpg

现在大家是怎么做的,卡在哪。 所谓万能修图(unified image restoration),指一个模型同时应付去噪、去模糊、低光增强这一揽子退化,而不是一个退化训一个模型。主流配方拿 Stable Diffusion、Flux 这类文生图模型当底座,把退化图作为条件喂进去,在「隐空间」里做去噪——隐空间指 VAE(变分自编码器,把图像压成小几十倍的紧凑表征)压缩后的中间世界,扩散模型在这个小空间里干活,省算力。但这套配方有两处先天别扭。其一,VAE 是为「生成好看的图」压缩的,它丢掉的恰恰是修图最需要的东西:低照度下噪点的真实结构、模糊边缘里残存的高频,这些「复原敏感」的细节在压缩时没了,后面的去噪网络只能靠猜。其二,生成模型的看家本领是「编得好看」,而修图要的是「忠实还原」,借来的生成先验会往画面里塞训练时见过的纹理,出现内容对不上的伪影。再叠加多步采样的耗时,这条路在手机端基本落不了地。

转折一:不借地基,自己打。 PixRestore 干脆不用 VAE、不要文生图预训练,直接在像素空间从零训练一个扩散 Transformer(DiT,即拿 Transformer 做去噪网络的扩散模型)。像素空间的代价是数据量爆炸,论文用两个手段压住:把图切成小块(patch)当 token,并用流匹配(flow matching,学一条从噪声到真实图像的近似直线的生成路径)让训练更稳。同尺寸对照实验里,像素方案全面好过隐空间方案——换成隐空间的版本 PSNR 26.62 对 22.80,细节保留的差距一眼可见。

转折二:条件注入做「分诊」,不做「全收」。 退化图里不是所有信息都可信:有的层还留着结构,有的层已被退化污染。作者用冻结的 DINOv2(一个自监督预训练的视觉编码器)抽取退化图的逐层特征,拿它与高质量图特征的逐层相似度当「可靠性」的标注,训练一个轻量路由器:可靠的层密集注入当条件,不可信的层反而在损失里加强监督,逼模型把退化当病治掉,而不是照单全收。

转折三:多步压成一步。 最后把多步模型蒸馏成单步生成器——判别器架在 DINO 特征上做对抗训练。最终约五千万参数、一次前向 44 毫秒,比 PromptIR、DiffUIR 这类统一复原模型快 7 到 23 倍,开销只有直接架在文生图大模型上方案的百分之一到千分之一量级。这个数字意味着它有资格进手机端的实时修图管线,而不是只活在服务器上。在真实退化测试集上,它也以微弱优势排在第一。

https://arxiv.org/html/2608.16793v1/image/framework-arxiv.jpg

能进哪些真实工作流。 相册和相机的「一键增强」是最直接的:端上现在靠手工管线加小型网络分任务处理,一个一步出图、小体量的统一复原模型给了换方案的理由。云端批量修复——老照片整库修复、素材库清洗——单步推理把成本直接降一个量级。更远一点,它给整个 all-in-one 复原方向提了个问题:生成先验不是免费午餐,当任务本质是「还原」而非「创作」时,小而专的像素模型可能比借来的大底座更划算。

局限与存疑。 论文自己承认两处硬伤:模型绑定单一分辨率,换分辨率要重训,而消费级产品面对的图片尺寸五花八门,这是落地真痛点;五千万参数的容量,对信息几乎丢光的极端退化,仍未必打得过十亿级的文生图底座。还要补一句:从零训练并不免费——它把成本从推理端挪到了训练端,扔掉了文生图预训练白给的先验,「从零练」和「借力练」在更大规模上谁赢,这篇还没给出终审。另外其主评分离 DR-Score 依赖一个 VLM 打分,分数会随 VLM 版本漂移,跨论文比较时要留个心眼。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读