这篇论文有意思的地方,不在把文生图的观感又推高了一截,而在换掉了生成模型的「交付物」:以前交付的是给屏幕看的成品照片,现在交付的是一份数码底片——记录画面里每一处到底有多亮的线性图,进专业后期流程时还留着全部余地。
先说现在大家是怎么做的。文生图模型学的几乎全是网上的成品图:这些图经过相机 ISP(图像信号处理器,把传感器电信号加工成照片的那条流水线)调过色、压过动态范围,亮度被锁死在显示器能显示的区间里。这类图叫「显示导向」;而「场景导向」的线性图记录的是成像面上的真实光强。成品图的麻烦是单向的:高光压成纯白、暗部拉成纯黑之后,信息就没了,后期怎么拉都拉不回来。摄影师为了留余地会拍 RAW,但生成模型从来不给这个余地。
为什么一直没人做?两堵墙。一是数据:RAW 文件基本锁在摄影师硬盘里,公开的只有调过味的 JPEG。二是模型结构:扩散模型里负责把大图压缩成小潜码的 VAE 只见过 0 到 1 之间的普通图,而一张真正线性的图,最亮和最暗可以差成千上万倍,压一次码,高光和暗部同时失守——效果就像给模型塞了一台动态范围严重不足的传感器。
作者的招数借自摄影圈的老手艺:曝光包围(同一场景按不同曝光连拍几张,后期合成一张高光暗部都在的照片)。既然一张线性图装不进 VAE,就把它按曝光拆成四张普通图——分别减四档、减两档、正常、加两档,每张都裁到 0 到 1 之内,单张就能被现有 VAE 干净编码。生成时四份潜码拼在一起联合去噪:底座是 Flux,只加 LoRA(冻结原模型、只训一小片附加参数)微调,再配一个「曝光调制自注意力」让四张图互相对齐、又各管各的亮度。没有直接竞品,作者把几条现成路线改造成对手:直接微调文生图模型,亮暗同时失守;借视频模型把四帧压进一个潜码,分布根本对不上。在 Adobe FiveK 测试集上,这套做法把 FID(衡量生成分布与真实照片分布的距离,越低越好)从 32 降到 28;而衡量画面能容纳的亮暗跨度的指标,是几个改造基线里可计算最好成绩的两倍半。
还有一件线性域特有的事:同一个场景可以整体很亮、也可以整体很暗,sRGB 里不存在这个自由度。所以模型额外带一个「辐射尺度 token」,跟图像一起参与去噪,专门猜「这张图整体有多亮」——从文字线索(黄昏、洞穴)和画面内容里一起定。四张图生成完,再按 HDR 摄影的老办法融合回一张完整的线性图。训练数据是约两万五千张 RAW,文字标注由视觉大模型 Qwen2.5-VL 批量生成。

往真实工作流里放,几个落点是可以预想的。修图与相册:AI 生成图的交付形态从「一张 JPEG」变成「一份底片」,用户能在生成结果上重新定曝光、改白平衡,而不是只能接受模型调好的那版味道。编辑工具原生化:现在的 AI 编辑模型只吃 8 位成品图,底片必须先转 sRGB、先丢一次信息;论文演示了在线性域里直接做文字编辑、ControlNet(用草图或深度图控制生成的条件模块)和修补,等于把「先编辑、后成像」的顺序搬进了生成管线。渲染与打光:游戏影视需要 HDR 环境贴图,主流做法还是「先生成普通图、再用逆色调映射去猜高光」,两段误差叠加;直接生成线性光让这条链路短了一截。相机产品:作者名单里有 Adobe 的相机团队,这类「生成式先验长在 RAW 域」的能力,更可能先落进相机 App 的夜景和 HDR 管线,而不是纯创作工具。
存疑的地方也说清楚。第一,包围数量目前只有四张,论文自己承认帧数一多曝光关系就不稳,分辨率也受底座模型上限约束。第二,训练数据全是审美分过筛的真实照片,生成机器人、机械结构这类非真实内容会掉链子。第三,这个方向没有直接竞品,所有基线都是作者改造出来的,动态范围指标也是自定义的——「生成的光在物理上多可信」还缺一个独立于模型自身的硬校验,这是这条路线真正要补的一环。但方向本身值得记住:当生成模型开始交付底片而不是成品,修图、渲染和相机管线都得跟着重新排座次。