这篇论文有意思的地方在于:它把超分辨率的原料从「模型编的纹理」换成了「同一件物品在别的照片里的真纹理」——放大低清图时,毛衣的织纹不再是猜的,而是抄的。
编出来的细节,是个行业尴尬
现在手机和云端的「AI 画质增强」大多是生成式的:一个扩散模型(一类靠逐步去噪来生成图像的大模型)看着模糊小图,想象高清版长什么样。画面确实好看,但补出来的细节是编的——织纹、砖缝、皮肤质感看着合理,凑近全是模型按统计规律画的。这也是修复过的照片不能当证据、电商平台对 AI 修复商品图很谨慎的原因之一。
早有一条「参考图超分」路线想解决这个问题:给模型再看一张高清照片,把纹理借过来。但它借的通常是「同类」——另一件风衣、另一面砖墙。风格接近,细节仍对不上。
关键转折:从「同类」收紧到「同一件」
GraftSR(arXiv 2608.25334)把参考收紧到同一实例:你拍糊的那件外套,电商图库里本来就有它的多角度高清图。作者据此构建了 TexRefSR-141K——14.1 万组训练数据,每组是一张人为退化的低清图、同一商品的高清参考图,以及两边各自的物体区域标注,并配套了一个小规模评测集。
难点在于两张图完全不对齐:角度不同、位置不同,直接把参考特征灌进模型,背景和别处的纹理会一起串进来。论文的转折是把笼统的「借」拆成两个明确的问题:从参考里取什么(一张掩码圈住参考图中的目标物体),往低清图里贴哪里(另一张掩码圈住它在目标图中的位置)。掩码由大模型协作产生:一个视觉语言模型(能看图并用文字回答的多模态大模型)先判断两边拍的是同一件什么,通用分割模型 SAM3 再按这个名字把物体抠出来。
生成主体同样是现成大模型:作者没有从头训练,而是在开源图像编辑模型 Qwen-Image-Edit 上挂了一个 LoRA(只训练一小片新增参数的微调方法),让「编辑大模型」改行做参考引导的超分。消融实验显示,这种掩码软注入比常规的交叉注意力注入更能保住纹理一致性。在其自建评测上,感知指标 LPIPS(越低表示人眼感知越接近)比此前最好的方法低约 20%;50 组场景的小规模人评中,82% 的选择压过最强对比方法,也压过让 Gemini-3-Pro 直接做超分。

会先落在哪
电商是最直接的落地点:商品图库天然就是「同实例多视角」,买家秀的糊图可以照着官方图修。相册是第二站——同一场景的连拍、多设备照片、聊天群里转存的压缩图,任何一张清楚的都能给其它糊的当参考。再往远处,影像工具里可能多出一类「纹理出处」标注:修图时记录哪些细节来自哪张参考图,这与当下对 AI 内容溯源的要求是同一个方向。
局限与存疑
它假设参考图存在且检索正确,而论文直接从图库取参考:检索错了会怎样?外形相似但不是同一件的商品,会不会被悄悄「替换」细节?正文没有讨论——实际产品里,检索这一环未必比生成容易。其次,训练数据全部来自时尚电商,纹理域偏窄(布料、皮革为主),换到自然场景是否成立待验证;作者也承认输入退化太重时会为保真牺牲细节。还有一层不该忽略的反面:同一个能力反过来用,也能把 A 图的细节「合法地」搬进 B 图,真要在取证场景落地,参考图的来源链路必须可审计。
(完)