改完一处,整张图都变了:EditMod 把建模对象从「图像」换成「这一次改动」

🧠 大模型影像论文精读 · 2026-08-13 · Image Editing · Visual Autoregressive · Diffusion · Text-Guided Editing
arXiv 2026-08 · 文本指令图像编辑;把编辑从「重画一张」改成「预测一份改动量」
图片来源:Fang et al., arXiv:2608.09057

这篇论文有意思的地方不是又刷高了某个编辑指标,而是换掉了被建模的对象:以前是「给定原图和指令,生成目标图」,它改成「生成这一次改动」。

https://arxiv.org/html/2608.09057v1/Method.png

先说清楚现在卡在哪

你给编辑模型一张海边的狗照,说「换成狼」。回来的图里狼是有了,但沙子的颗粒变了、海水的蓝偏了、构图还悄悄挪了两像素。这不是模型不听话,是它压根没打算保留原图——主流的文本编辑走反演加重绘:先把成品图一步步倒推回扩散模型的噪声起点(这一步叫 inversion,反演),再拿新指令从这个噪声重新生成一遍。往返一趟本就会漏掉部分原图信息,重绘时模型又要为整张画面负责,于是没被指令提到的地方也一起被重新想象了一遍。

这条路线打了很多补丁:注意力控制(把原图生成时的注意力图钉住,强迫新图沿用)、用户画蒙版圈出可改区域、逐张图做测试时优化。都有效,但都在治症状,代价是慢。文中的对比很直观:P2P 编一张 16.5 秒,MasaCtrl 20.3 秒,EditInfinity 更是 212 秒——这个量级进不了任何交互式修图界面。

方法的转折:问两遍,取差

EditMod 建在视觉自回归模型(VAR)上。这类模型从粗到细逐级预测:先出一张极低分辨率的「缩略图」token,再一级级往上加细节。原图能直接编码成这串多尺度 token,本身就是模型的一个合法中间状态。(顺带澄清:已有的 VAR 编辑方法照样在用反演和蒙版,不用它们是 EditMod 的选择,不是 VAR 自带的性质。)

它的招很朴素。在某一级上,让模型在完全相同的上下文下预测两次:一次条件是原图描述,一次是新指令。两次预测都含有模型对「这张图接下来该长什么样」的共同判断,而它们的把共同判断抵消了,剩下的就是这条指令引起的位移。把位移当残差加回原图 token,逐级推。

落地分三段:最粗的几级完全不动,布局因此锁死;中间几级施加差分;最细的几级放开,让模型自由采样纹理——毕竟狼毛不是从狗毛上加个偏移量能长出来的。

结果是保真这一侧领先:PIE-Bench 上 CLIP-I 0.9120、LPIPS 0.2212。两个指标都在量「和原图有多像」,方向相反:CLIP-I 越高越像,LPIPS 越低越像。文本对齐 CLIP-T 0.3096 保持在有竞争力的位置。速度是单卡 A100、1K 图端到端 1.57 秒,不需要逐图预处理——重点不是比 212 秒快多少倍,而是跨过了「点一下要不要等」的阈值。

这东西可能落到哪儿

最直接的是相册和手机修图的即时编辑。一键换背景、换天空之所以只能做窄任务,很大程度就是通用编辑模型不敢上——用户自己拍的照片被改坏一点点就会被察觉。把改动量单独建模、粗尺度锁死,正对应「别的地方一个像素都别动」这个产品要求。

往专业侧走,「差分」这个中间量是可暴露的。今天的 AI 修图一次性给结果,只能接受或重来;如果编辑被表示成一份可缩放的位移,它天然能做成带强度滑杆的图层:改到 60% 什么样、局部调弱什么样,都变成可操作的东西。

需要打问号的地方

第一,保真度指标偏心。CLIP-I 和 LPIPS 都奖励「改得少」,什么都不改的方法能把这两项刷满;而论文的文本对齐只是「有竞争力」而非领先。这类残差方法最该被追问的,就是它在大幅度编辑上会不会缩手。

第二,位移假设的适用范围。「共同响应会相减抵消」对换材质、换物种、改颜色这类原地替换是合理的;但改姿态、改视角、增删物体动的是布局,而布局恰恰被粗尺度锁死了。

第三,那两个尺度阈值是手调的,跨图像跨指令是否稳定还没有答案——这决定它能不能当通用组件用。

— Fang et al., Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective, arXiv:2608.09057

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读