评画质别光动嘴:MR-IQA-2 把「说得出毛病」变成「改得动图」

🧠 大模型影像论文精读 · 2026-08-31 · IQA · MLLM · Reinforcement Learning · Faithfulness · Image Editing
arXiv 2026-08 · 大模型图像质量评价中的「理由可验证性」;让模型按自己的诊断真去改图,再用裁判复评的涨分检验理由是否忠实

画质模型早就学会了"打分附赠一段理由",可理由是不是编的,一直没人查。这篇论文的办法简单粗暴:你说图哪儿不好?行,按你说的把图改一遍——改完分数真涨了,才算你看懂了。

图像质量评价(IQA,给一张图打一个"看起来好不好"的分数)这两年换了引擎。早期是卷积网络直接回归一个分;多模态大模型(MLLM,既能看图又能写字的语言模型)进场后,模型开始输出"左下角过曝、紫色眩光干扰主体"这样的诊断,训练也改用强化学习(靠奖励信号调整模型,而不是抄标准答案),把人类评分当奖励。

死穴在于:**分数准不准,和理由忠不忠实,是两回事。**一段流畅的诊断配上一个碰巧正确的分数,在训练里和"真的看懂了"拿同样的奖励;奖励根本不检查证据,模型自然学会写"像那么回事"的话。放到画质评价里这尤其麻烦——下游真的会拿这句话去指导修图。

MR-IQA-2 的转折,是把"解释"从一句话变成一个可执行的干预,再测这个干预灵不灵。框架里三个角色,只有第一个在训练:

  • 演员是一个多模态大模型,看图后必须写清三件事:证据(哪里不好)、方案(怎么改)、分数;
  • 剪辑师是一个冻结的图像编辑扩散模型,照着方案真把图改一遍,只许动画质、不许改内容;
  • 裁判是另一个冻结的预训练打分模型,分别给原图和改后图打分,两者之差就是这条理由的"证据强度"——按你说的毛病修完,分涨了,诊断才算成立;没涨,理由就是空话。

https://raw.githubusercontent.com/RobinY99/MR-IQA-2/main/assets/figures/masked_credit_assignment.png

更关键的一刀是怎么算账。如果整段输出共用一份奖励,模型会找"一招通吃"的偷懒解。论文的消融实验把这一点拍在了桌上:不拆账时,画质涨分确实更高,但所有图的修改方案收敛成了同一个套路,理由实际上退化了;拆账之后——证据和方案只听裁判反馈、分数只听人类评分,各管各的文字部分——两万多种不同的修图方案保住了,涨分也没掉。换句话说,“把分刷高"和"真的会看"必须分开算账,混在一起,前者会吃掉后者。

成没成?打分水平没掉,与同规模方法持平;拉开差距的是理由:按模型自己的理由去改图,裁判在五分制上测得约 0.8 分的画质提升,已发表的推理式评价方法只有 0.2,而直接拿人类分数练理由的版本干脆是负的:只会刷分的模型,按它的理由改完图画质反而更差。

往真实影像工作流上看,这套机制的价值不在"分数更高”,而在解释第一次可以被机器验收。修图 App 里那句"检测到过曝",背后可以挂一个"改给你看、再复评"的闭环:建议是否采纳由复评涨分决定,而不是模型的自信程度;批量挑片同理,理由可抽查,人只验那些没兑现的。夜景合成、变焦增强这些"生成式相机"功能也能用它当验收裁判:增强前后各打一次分,涨了多少就是多少。

局限也得说清。闭环没有真正闭上:改后的图没有回流给演员继续反思。三个模型叠着跑,一次编辑加两次评分才换来一份训练信号,离端上还远。最大的隐患在裁判自己——它也是个多模态大模型,它的口味偏差会被原样固化成"什么算好理由"的定义。编辑器的能力上限也可能被记到理由头上,论文自己举过一个例子:一次改图把夜空修成了白天的蓝天——这种内容漂移算谁的错,目前分不清。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读