把模糊、雨雪、雾、暗光、低分辨率的「废片」救回来,这个方向叫图像复原。这两年它最流行的配方,是拿文生图大模型当底座——这类模型在几十亿张图上见过世界,让它们「脑补」细节天经地义。PixRestore(arXiv 2608.16793,香港理工大学与 OPPO)把这个配方掀了:不用文生图先验,连标配的 VAE 都扔掉,从零训一个五千多万参数的小模型,反而赢了。
为什么要借文生图的底座
因为复原长期是「一种退化一个模型」:去雾的不管雨,去噪的不管暗光。统一复原想让一个模型全包八种坏事,就得先看懂图才知道怎么救——文生图大模型看起来正是那个见多识广的部分。
但这条路线有两个死穴。一是文生图模型的入口是 VAE(变分自编码器):先把图压成一张小得多的「潜空间缩略图」,生成完再解码放大;可复原要抢救的恰恰是最容易被压掉的细小笔画和锐利边缘——先丢细节再找回,自相矛盾。二是生成先验太「会画」:它会往模糊的人脸上补一根不存在的睫毛、把糊掉的字「读」成另一个词。看起来更清楚,内容却不忠于原图——对修图是功能,对复原是事故。
三个转折
第一步,扔掉 VAE:图像直接切成小方块,一块当一个「词」喂进扩散 transformer(用 transformer 当骨架的生成网络),生成用流匹配——不随机一步步去噪,而是学一条从噪声图到干净图之间近似直线的搬运路径;路径够直,才能一步出图。

不借文生图,理解力从哪来?用 DINOv2——一个无需人工标注、自己从海量图里学特征的视觉基础模型。它像一排眼睛:浅层看边缘纹理,深层看物体语义;特征经交叉注意力(让生成网络边生成边「回头看」)喂给复原网络。
全文最巧的机关是自适应层路由:同一层特征在不同退化下可信度不同——雾保留结构但毁色彩,运动模糊先毁高频细节。训练时把坏图、好图分别过 DINOv2,逐层比对相似度,就知道「这次退化下哪几只眼睛还睁着」,再训一个轻量预测器只看坏图就能估出权重。可信的层拿来做条件;不可信的层不当条件,反而加重监督,逼模型把里面的坏东西洗掉。最后用 DINO 特征上的对抗训练(再养一个判别器专挑「像编出来」的破绽)把多步模型压成一步,单次推理约 44 毫秒。
成了吗
最硬的证据是一组对照:同一个 transformer 骨架,像素路线拿到 26.62 dB(保真指标 PSNR,越高越好),几种 VAE 潜空间路线最好的也只有 22.80 dB——近 4 个 dB,把「VAE 是瓶颈」钉死了。在去模糊、去雾、去噪、去雨、去雪、低光、4 倍超分八个任务上,保真与观感指标大多第一或第二;五千多万参数对比百亿级文生图底座方案,快 7–23 倍。
会进哪些工作流
对影像产品,相册的「一键增强」不必每种退化养一个模型,轻量统一模型有资格进实时预览管线。更值得记下的是选型信号:复原是保真优先的任务,细节通道比生成想象力值钱——新闻存档、证件翻拍这类怕「编细节」的场景,反而该用不会画画的模型;各家「AI 增强」在好看与忠实之间怎么站队,也该对用户说清楚。
边界与存疑
固定切块意味着换分辨率要重训,高分辨率得拆图处理;近乎全黑的极端暗光下,小底座的「脑补」可能仍不敌十亿级生成模型;真实场景打分用的是作者自家的视觉大模型裁判,跨论文可比性要打折。PixRestore 赢的是保真与观感的综合平衡,没有宣判生成先验死刑——但「复原需不需要想象力」,值得在视频与高分辨率上接着验证。