把「会推理的修图」塞进手机:VeraRetouch 用 0.5B 小模型 + 可微调色渲染器闭环

🧠 大模型影像论文精读 · 2026-07-21 · VLM · Photo Retouching · Differentiable ISP · Color Grading · On-device
arXiv 2026-04 · 修图/调色 + 端上可微渲染,色彩相关

这篇有意思的地方不在于「又做了一个会修图的大模型」,而在于它把过去一年最热的那条路——让 MLLM 学会去点 Lightroom 的两百多个滑块——直接判了死刑,改成一件更朴素的事:让模型自己「想」,也让它自己「动手」,而且这只手是可微的。

问题背景。 JarvisArt、MonetGPT、RetouchIQ 这一批工作走的都是同一个范式:把多模态大模型当成一个会读懂「帮我把这张逆光人像提亮、肤色调暖一点」的大脑,然后让它去调用专业修图软件里的工具链。听起来很美,但工程上有个死结——那些外部工具是不可微的黑箱。模型输出一串参数丢进 Lightroom,出来一张图,你却没法把「这张图好不好看」的梯度回传给模型。于是训练只能靠强化学习在参数空间里盲试,或者退回到「跟一张参考图算 L1」的老办法,像素级的端到端优化根本无从谈起。

方法的关键转折。 VeraRetouch 把这条链路整个搬进了可微世界。它用一个只有 0.5B 参数的 FastVLM 当推理脑子——先分析画面缺陷、给出一段调整理由,再生成调色策略;真正执行的是作者自研的「Retouch Renderer」,本质是一个逐像素的 MLP 颜色映射,把光照、全局色彩、局部色彩三层调整全部写成可微算子。整条「看图→推理→出参数→渲染成片」的路径梯度贯通,就能在像素层面端到端训练,作者还上了一套针对审美认知的 RL 后训练(DAPO-AE)和百万级修图数据集 AetherRetouch-1M+。结果是 FiveK-Bench 上 PSNR 26.85 dB、Aether-Bench 上 30.18 dB,都刷过了基线。

对做色彩和 ISP 的人来说,真正值得盯的其实是那个渲染器:它等于把「专业调色师的一套操作」压成了一个可训练的可微调色模块——这不就是一个由自然语言意图驱动、能反向传播的软件 ISP 后端吗?

能进哪些真实工作流。 最直接的是相册里的「一键修图」和手机端的实时调色:0.5B 的体量让它在 MacBook Air M4 上 7.4 秒、iPhone 16 Pro 上 13.5 秒就能出一张,比 Flux.1 Kontext 那类扩散方案快一大截,属于真能塞进端上的量级。往色彩科学这边发散,它给出了一个诱人的模板——把 AWB、tone mapping、局部调色这些传统 ISP 里手工调的环节,替换成「小 VLM 出策略 + 可微算子执行」的组合,让整条 ISP 后端既能被一句话调参,又能端到端拿 GT 或审美 reward 去训。可解释性也是顺带的红利:每次调整都附一段推理,比黑箱增强至少让人知道它「为什么把这块压暗」。

局限与存疑。 0.5B 的推理深度终归有限,遇到复杂混合光照或需要真正理解场景语义的场景,那段「reasoning」到底是因果推理还是话术,需要打个问号——审美类 RL 的 reward 本就主观,很容易训出「讨好评测」的风格。更实际的是,Retouch Renderer 和 AetherRetouch-1M+ 都是自研、未开源,逐像素 MLP 映射能覆盖多广的调色操作、会不会在高饱和或肤色边界上翻车,光看论文还判断不了。但它至少把方向摆正了:与其让大模型隔着一堵不可微的墙去够工具,不如把工具本身重写成模型能一起训练的样子。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读