图像编辑模型可以替你把天空调蓝、把路人抹掉,却很难替你把照片往下压 10 度、往后退两步「重拍」一张。CameraEditor 的做法是把这件事从空间问题改写成时间问题:别一步到位地变换图像,让画面像一段视频一样自己走过去。
问题卡在哪。 现在主流的指令编辑模型(如 FLUX.2、Qwen-Image-Editing 这类开源模型)改语义、改风格已经很能干,但「相机参数」这一类指令——旋转、俯仰、视场角、镜头畸变——是它们的死穴。论文观察到两种典型失败:角度给大一点,输出直接结构撕裂,房子的直线扭成曲线;或者模型干脆保守敷衍,图基本没动。根源在于通道不匹配:相机参数是连续、可度量的物理量,而文字是含糊的——「往上抬 15 度」这种话模型听不准,几何词汇还常被误解成语义改动。改用像素级控制图(深度、法线这类逐像素的几何提示)倒是精确,却会伤整体结构。
转折在哪里。 相机的移动本来就是一个连续过程:你没法瞬移到新机位,但可以走过去。CameraEditor 因此把「编辑后的目标图」重新定义成「一段九帧视频的最后一帧」,由视频扩散模型(生成连续视频帧序列的生成模型)来出图,靠视频天然的帧间连贯性保证几何一路平滑。光有这个想法还不够,它补了三件事。第一,提示不用文字,用图:训练和推理都从全景图里按目标相机参数裁出「参考图」,几何上严格、不含糊——训练数据也用同样方式从实拍与 UE5 全景池合成,共 5,760 对。第二,在参考帧和目标帧之间插入八张中间过渡帧,把一个大角度拆成八个小步,每步只需小改,结构就不容易崩,这相当于给变换加了一道时间缓冲。第三,推理时先用 GeoCalib(一个从单张照片估计相机姿态的工具)读出原图的拍摄参数,再据此动态挑选最合适的参考先验。

成没成。 论文同时发布了评测套件 CamEditor-Bench(462 个测试用例),并用透视场做几何度量——透视场是把每个像素的重力方向和纬度编码成一张「场」的几何表示,可以免优化地比对两张图的视角结构是否一致。与六个开源编辑模型(ICEdit、Step1X-Edit、OmniGen2、FLUX.2、Qwen-Image-Editing 等)相比,它在机位控制精度和原图内容保持两头都排第一;消融实验说明收益确实来自显式几何条件和序列参考,而不是换了个更强的底座模型。
能进哪些工作流。 最直接的是相册和修图应用:重新构图从「裁剪」升级成「重拍」,拖滑杆就能把主体拍得更正、机位压得更低。电商和房产图可以由一张实拍图导出任意机位的变体,省掉现场补拍。它也划出了与 3D 重建的分工:只要一个新视角时,未必要先建出完整三维模型。另外,这套基于透视场的几何评测协议本身,可能会被影像质量评价的工作流借用——「机位是否到位」第一次有了可算的尺子。
局限与存疑。 5,760 对训练数据在同类工作里偏紧凑,全景裁剪合成的目标图与真实大角度拍摄之间的差距,论文没有完全消解;一次编辑要生成九帧,推理开销明显高于单次前向的图像编辑模型;评测基准和指标都是作者自提的,第三方结论还要等代码放出——目前其 GitHub 仓库仍是空的。方向本身是稳的:把几何精确性外包给视频的时间维度,这条路大概率会被后续编辑模型吸收。