过去做 inverse-ISP(从 sRGB 成品图反推相机 RAW),几乎都是训一个专门的回归网络,逐台相机去拟合它的 ISP 曲线。RawGen 这篇(Michael Brown 组,2026-04)有意思的地方在于:它不再「造一个 inverse-ISP 网络」,而是把一个从没见过 RAW、只在海量 sRGB 成品图上预训练的扩散大模型,反过来「逼」它吐出物理上成立的、场景参照(scene-referred)的线性 RAW——甚至能凭一句文字,为指定型号的相机凭空生成一张 RAW。

问题背景。 低层视觉——去噪、去马赛克、AWB、HDR、RAW 超分——都更愿意在线性 RAW 域训练,因为 RAW 忠实记录传感器响应,没有被 ISP 的非线性色调曲线和白平衡搅乱。但 RAW 数据集稀缺、相机相关、采集昂贵,长期是个瓶颈。传统 inverse-ISP 方法通常假设一条固定的、已知参数的 ISP 管线,一旦换相机、换厂商调校就崩。而现成的大扩散模型(Stable Diffusion 那一类)全是在 8-bit sRGB 成品图上训练的,它们「懂」自然图像的结构先验,却完全活在 display-referred 的非线性色彩空间里,跟物理 RAW 隔着一整条 ISP。
方法关键转折。 转折有两处。第一,它不直接生成某台相机的 RAW,而是先在 latent 和 pixel 两个空间里把扩散先验迁移到一个设备无关的中间量——线性 CIE XYZ,再由解码器映射到任意目标相机的 RAW 空间;这一步把「重建物理线性信号」和「套上相机特定响应」解耦。第二,为对付训练数据里五花八门、参数未知的 ISP 调校,作者构了一个 many-to-one 的 inverse-ISP 数据集:同一场景用多种 ISP 参数渲染出多张不同的 sRGB,全部锚定到同一个 scene-referred 目标上,逼模型学会「无论成品图被怎么调过,都往同一个物理源头收敛」。于是它成了第一个能对任意目标相机做 text-to-RAW、又能做 sRGB-to-RAW 反演的扩散框架。数字上,XYZ 重建在 FiveK 上 PSNR 23.2–24.4 dB,明显高于 CIE XYZ Net 的 19.5–21.0;更值得色彩圈注意的是下游光源估计——用 RawGen 合成 RAW 训练的模型角度误差 3.14°,优于 Graphics2RAW 的 4.21°,已逼近真实数据的 3.02°。
应用发散。 对拍照 / 相册 / 修图工作流,这条路的价值是「补 RAW」。手机相册里存的都是 sRGB 成品,一旦想重做白平衡、重曝光、做 HDR 融合或设备无关的色彩还原,理想输入是线性 RAW,而 RawGen 提供了从成品图倒推回可编辑线性域的可能。对训练侧,它是廉价的 RAW 数据增广机:给去噪、去马赛克、AWB、RAW 超分批量造带相机响应的 RAW,尤其是跨相机泛化(换一台相机就换一套 RAW 分布),这正是 color constancy、CCM、光谱重建长期缺数据的地方。text-to-RAW 还打开一个更远的口子:为还没上市、或手里没有的传感器,先用文字描述场景合成 RAW 做算法预研。
局限与存疑。 最大的存疑是「物理正确」和「视觉合理」之间的张力。扩散模型天生会「幻想」细节,它生成的 RAW 好看、统计上像,但到底有多 scene-referred、噪声与光子统计是否物理成立、暗部线性是否可信,这些才是它能否真进 ISP/AWB 训练管线的关键,光靠 PSNR/SSIM 说不清。其次,相机特定性仍需 per-camera 数据去标定解码器,「任意相机」的边界有多宽要看。再者论文暂无开源,text-to-RAW 的颜色可控性和可复现性得等代码。对做真实 ISP 的人,我更愿意把它当「数据引擎」而非「物理真值」来用——它擅长造分布,不保证造真相。