别再借文生图的隐空间修图:PixRestore 把图像复原搬回像素空间

🧠 大模型影像论文精读 · 2026-09-03 · Image Restoration · Diffusion Transformer · Pixel Space · Model Distillation
arXiv 2026-08 · 统一图像复原:从零训练、直接在像素空间工作的扩散 Transformer

过去两年,图像复原——把模糊、噪点、欠曝的照片修清楚——几乎都盖在同一块借来的地基上:拿现成的文生图大模型当底座,加一个控制分支或一层微调,让「会画画」的模型顺便学会「会修图」。PixRestore(arXiv:2608.16793,香港理工大学与 OPPO 研究院)换了个问法:能不能干脆不借?不用文生图权重,也不用它配套的压缩器,从零开始、直接在像素上训练一个复原专用的扩散模型。

这条路为什么流行,又卡在哪

借文生图底座的理由很直接:这类模型在海量图片上见过「世界长什么样」,拿它当先验,修出来的细节显得真实。但代价藏在两处。

第一处是隐空间。主流扩散模型并不直接看像素:图像先过一个变分自编码器(VAE,把大图压成面积上小几十倍的「摘要」,生成完再解码回去),所有去噪都发生在这个摘要空间里。压缩是有损的,最先被抹掉的恰恰是复原最在乎的高频纹理——发丝、草叶、布纹。让一个先撕掉细节的邮差去送「细节」,天花板是写死的。学界近年已多次指出这个问题,但主流应对仍是打补丁:想办法把像素证据重新「塞回」隐空间里去。

第二处是重量。这些底座动辄几十亿参数、几十步去噪,一次修复秒级起步,手机相册里的日常任务用不起。

一个不要底座的复原模型

PixRestore 把这两个借来的部件一起扔掉。它从零训练一个直接工作在像素上的扩散 Transformer(DiT:把图像切成小块、用 Transformer 逐块处理,预测从噪声走向清晰图的每一步),训练目标是流匹配——不一步步猜噪声,而是学一条从噪声直通干净图像的速度场。没有 VAE,就没有那个有损的中间层;从零训练,也就不欠文生图先验的债。

https://raw.githubusercontent.com/csslc/PixRestore/main/figs/framework.jpg

真正的转折在第二个问题:条件该信几分。复原以坏图为条件,但坏图的不同区域可靠程度天差地别——结构完好的地方该照抄,烂掉的地方该脑补。传统做法靠全局损失隐式权衡,或者在网络外面挂一个「保真/真实感」旋钮让用户拧。PixRestore 把这件事搬进网络内部:用一个自监督视觉编码器(DINO,一种不看人工标注、自己从图片里学特征的模型)分别提取坏图与干净图的特征,逐层算相似度,得到「每一层特征还剩几成可信」的分数,再据此决定各层条件注入的权重。退化重、可信度低,就少抄多补;语义清晰、可信度高,就严格照抄。「保真还是脑补」从外部旋钮变成了逐层自动分配。

最后是落地:用一个在 DINO 特征上计算的对抗目标,把多步模型蒸馏成单步生成器,参数量约 5000 万——比常见文生图底座小一到两个数量级,一步推理。按论文自建基准,它在保真度、感知质量、退化鲁棒性三头都排在前列,且更大变体继续涨分,说明这条从零起步的路线有扩展空间。

会进哪些真实工作流

最直接的是手机相册:夜景去噪、去模糊、老照片增强、压缩伪影修复,如今往往各挂一个模型,「一个 50M 单步模型全包」正是端侧预算内的形态。第二是作为下游前端:OCR、监控取证、大模型看图之前先过一遍复原,输入质量直接决定识别上限。更远处是成本结构——如果复原不再需要文生图底座,「修复功能必须挂大模型 API」的假设就松动了,端上自托管变得可行。

值得留意的同月信号:另一篇 PixelIR(arXiv:2608.30782)也选择了像素空间加一步推理,用「残差流匹配」把保真与真实感拆成两段生成。两篇独立工作撞向同一个选择,说明「离开隐空间」正在从异端变成选项。

局限与存疑

从零训练省掉了 VAE,也省掉了文生图先验的世界知识:极端退化下(人脸几乎不可辨)它的脑补上限受训练分布约束,而这恰是文生图先验的强项。逐层可信度由 DINO 一个编码器裁定,编码器的盲区会变成复原的系统性偏差。此外,「三头领先」出自作者自建基准与自选对手,换一套第三方口径复验之前,宜把它当作路线证明,而非最终排名。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读