SUPIR(意为“扩规模图像复原”)有意思的地方,不是又造了一个更大的超分模型,而是把“修复”改成一次有原图拴绳的生成:让大模型补细节,又不准它彻底另画一张。它发表于计算机视觉会议 CVPR 2024,却仍值得重看,因为今天所有生成式修图产品都绕不开同一道题——结果可以更漂亮,但还能不能当作原照片的证据?
传统复原通常先把清晰照片人工加噪、压缩或模糊,再训练模型把它还原。可现实中的旧照片、社交平台截图和手机夜景,往往同时经历失焦、降噪、锐化和多次压缩;真正丢掉的车牌笔画、毛发纹理根本没有唯一答案。只让输出像素逼近标准答案,结果容易平滑;直接借用扩散模型——一种从噪声逐步生成清晰图像的模型——又可能凭经验编出本来不存在的细节。
SUPIR 的第一步是把文生图大模型 SDXL 当作“见过大量清晰世界的底稿”,并用约两千万张高质量图像及其文字描述训练复原能力。视觉语言模型——也就是能看图并用文字概括内容的模型——先描述低质输入,让系统知道模糊处大概是自行车、帽子还是人脸。随后,适配器——把原图接入大模型的桥接网络——持续送入原图的空间结构;论文称其中的 ZeroSFT 可以理解为一条按位置注入原图特征、且从不扰动底座开始学习的支路。
真正关键的是“复原引导采样”:扩散模型每一步准备生成新结果时,都把它与低质原图的潜在表示做一次加权折中。潜在表示,就是压缩后的图像底稿。原图权重大,内容更可信但可能偏糊;生成权重大,纹理更漂亮却更容易虚构。于是,这项工作把过去藏在模型内部的取舍,显式做成了一个可以控制的旋钮。作者还专门教模型理解“模糊、脏乱、压缩伪影”等负面描述,使文字不只说画面是什么,也能说哪些质量问题不要出现。

按论文报告,SUPIR 在不需要真值图、只看结果观感的无参考画质指标和用户选择中表现突出,也能用文字指定想补的对象或材质;但它在部分逐像素对真值的指标上并不占优。这不是简单的评测失灵,而是结果更悦目与细节更忠实之间的真实张力。
这套思路可以进入老照片修复、相册清晰化、低清素材再利用和视频关键帧增强:系统先自动描述内容,再让用户选择“保守复原”或“增强观感”。更可靠的产品还应保存原图、生成强度与提示词,并允许局部回退;新闻、档案、检测图像和人脸身份信息则不该默认启用强生成。
它的边界也很清楚:大扩散模型加视觉语言模型计算开销高,并非天然适合相机端实时处理;文字描述可能看错,论文也承认负面提示在语义不清的区域会引入伪影。更根本的是,那根“保真绳”只能让结果靠近输入,不能证明新长出的纹理曾经真实存在。论文原文|官方代码