DiffBIR 有意思的地方,是把“一次修好坏照片”拆成了两份工作:先清理干扰,再让生成模型补上缺失的细节。
一张转发多次的老照片,可能同时模糊、带噪点、留下压缩方块。常见办法是训练网络从坏图预测清晰图,但它往往把纹理也抹平了。换成擅长画图的大模型,又有另一种麻烦:它可能把噪点当成物体纹理,认真地“画清楚”。所谓盲图像复原,就是不知道照片具体怎么坏的,还得设法修好;难点恰在于,画面内容和损伤已经混在一起。论文背景与观察
作者的关键转折是:给生成模型的参考图,应当先经过清理。 第一阶段用专门的复原网络去掉噪声和伪影,允许结果稍显平滑;第二阶段再利用 Stable Diffusion——一种通过逐步去噪来生成图像的预训练大模型——补出自然的纹理。接入的控制网络负责把清理后的画面作为约束,让生成过程跟着原有内容走。不同任务可以更换前面的清理网络,后面的生成模块共用,并非一个网络不加区分地处理所有损伤。方法
![]()
它还提供一根可调的“缰绳”:生成过程中,把结果往第一阶段的图像拉回。天空、墙面等平坦区域拉得更紧,避免凭空长出花纹;纹理丰富的区域则留出更多发挥空间。这里的保真,是贴近清理后的参考,并不等于已经找回拍摄现场的真相。
成没成?作者在放大、降噪和人脸修复上做了实验。更有解释力的是拆掉第一阶段的对照:论文表6中,两组数据上的所列评价指标都变差,图10还展示了异常眼形和背景。这支持“先清理再生成”确有作用。但表2也显示,加强约束能改善与原始清晰图的像素吻合,同时可能降低自动感知评分;看起来舒服与逐像素准确,仍要取舍。实验与对照
顺着这套分工,可以设想相册修复先提供保守版本,再让用户选择是否补纹理;夜景和数码变焦照片也可保留清理结果,供生成增强前后对照。修图软件还可以按区域限制“想象”的幅度。这些是产品延伸设想,论文没有验证完整工作流。
局限也很实际:第一阶段若丢掉关键结构,后面仍可能补错;自然的发丝不能证明身份细节准确。作者还承认,多轮生成计算开销较高。它给出了组织生成式修复的有效分工,却没有消除“修出来的细节究竟有多少是真的”这个问题。局限