有意思的不是它比 LPIPS 更准,而是它先承认了一件被度量学界回避了十几年的事:「这两张图像不像」本身是个没定义完的问题。同一对图,你问色调像不像、问形状像不像、问光照暖不暖,答案可以完全相反。TPIPS 做的事,是让你用一句自由文本把要比的那个维度指定出来。

为什么这件事对做颜色的人是刚需
我们手上评"图像差多少"的工具其实一直是分裂的两派。一派是 CIEDE2000 这类色差公式:定义严格、有标度、能写进公差,但逐像素、无空间上下文,一张图整体偏黄它给不出人眼那种"整体色偏"的感受。另一派是 LPIPS、DreamSim 这类深度感知度量:有上下文、跟人眼一致性好,但输出一个标量——颜色偏了、纹理糊了、构图变了,全被摊平进同一个数字。
这个纠缠在 ISP 场景里是致命的。你评一版新的 AWB 或 CCM,想问的是"色彩还原偏了多少",可 LPIPS 会把去噪强度、锐化差异一起算进去;你比两版调色,想看的是色调走向,它把主体位移也记了一笔。
方法上的转折点
作者(CMU + Adobe + Berkeley,含 LPIPS 的 Richard Zhang、Efros、Jun-Yan Zhu)没有去设计更好的特征,而是重做了数据协议:2.5 万组图像三元组、100 万条人类判断,关键在于每组三元组被在多个自由文本维度上分别标注,最终得到 26 万个「三元组 × 维度」组合。维度诸如 lighting warmth、color tone、color palette、surface texture、camera pose。
第一个值得注意的结论来自基准测试本身:现成的前沿 VLM 干不了这活。人类之间的共识率是 67.5%(随机 33.3%),最强的 Gemini-3.1-Pro 只有 58.4%,而 LPIPS 和 DreamSim 因为压根不看维度,只有 46.2% 和 50.5%。也就是说,“提示词写清楚点让大模型判断"这条捷径不成立。
用这批数据微调 Qwen3-VL-Embedding-8B 之后,与人类共识的差距从 9.1% 收到 2.8%;更重要的是在完全不同分布的验证集上——真实图像编辑、生成算法的输出做两选一——差距也从 15.8% 收到 10.0%,说明学到的不只是合成数据的偏置。
能进哪些真实流程
最直接的一条:给色彩还原做一个带上下文、又不被纹理污染的评分。评 AWB、CCM、跨设备一致性时,条件设成 “color tone”,让度量只在颜色轴上说话;这正好补上 ΔE 缺空间上下文、LPIPS 缺可解释轴的中间地带。
往外一步是生成与编辑模型的颜色保真度评测:现在几乎全靠人看,“改了姿势但保住色调"这种要求终于可以被量化。再往外,相册按色调检索、ISP 调参当感知损失、质量评价里单列颜色维度,都是顺理成章的接法。
但别急着当尺子用
有几条硬限制。训练三元组是文生图合成的,维度候选也由 VLM 提出,作者自己承认会系统性漏掉 VLM 想不到的维度——对色彩科学来说,这意味着它的"颜色维度"是语言粒度的,跟色相/彩度/明度这套有物理与心理物理定义的属性并不对齐,“color tone” 到底包不包含饱和度变化,谁也说不清。
更关键的一点:它输出的标量没有标度。模型确实给出连续分数、能对 170 万张图排序,但监督信号全是序关系(谁更像),这个数没有任何 JND 或 ΔE 单位的锚,回答不了"偏了多少”。想拿它替代 ΔE00 写进验收公差,路还长。另外论文只报了跨全部维度的总体一致率,没有单独给出颜色维度上的准确率——它在 color tone 上是不是和在 camera pose 上一样可靠,目前无从判断。此外标注人群不代表所有观察者;VLM 推理成本远高于 LPIPS,每个维度还要单独编码索引,实时闭环里用不动。
值得看的理由不在于它现在能不能用,而在于它把"感知距离该不该是一个标量"这个问题正式摆上了桌。做颜色的人应该比谁都清楚:答案是不该。