上个月读过一篇「颜色在视觉大模型里被存成了什么」——那问的是表征的全局结构。今天这篇问的是另一件事,也更贴工程:模型手里那把局部色差尺子,刻度对不对。

为什么现在该问这个
一个颜色要偏多少人才看得出来,是色彩科学最老的题目之一,答案最终被写成了 CIEDE2000——而且是椭圆不是圆,因为人眼容差在不同色相、不同彩度上各向异性。
今天的影像系统里,「距离」这件事悄悄换了人做。感知损失、CLIP 相似度、latent 空间的重建误差,都在以特征距离的身份充当「像不像」的裁判。它们一旦进了 ISP 调参回路、进了生成模型的保真度评价,实际上就在替代色差公式。那就该问:它们的等距面,长得像 CIEDE2000 的椭圆吗?
方法的关键转折
作者(Ehab 等,含 Vazquez-Corral、Malo 两位色彩视觉方向的人)没让模型「说」颜色,而是把心理物理实验的形状直接搬进特征空间。
CIELAB 上取 18 个参考色,恒亮度,跨 4 个彩度层 C∈{5, 20, 60, 80};围绕每个参考色在圆域内采 500 点,250 个落在 CIEDE2000 划出的等色差域内、250 个在域外;过编码器取特征,按与参考色的余弦距离取最近的 250 点当作模型自己的辨别域,再与人类参照域算 IoU。于是「有没有人眼式阈值」变成一个能对任意 encoder 批量跑的重合度测试——50 多个模型,CNN 与 ViT 一起上。
结果是一条低平线:全体家族对齐都弱,最好的 mIoU 也 < 0.25。自监督(DINOv2、Perception Encoder)总体好于有监督;语言监督(CLIP 系)最两极分化,榜首榜尾都有;VGG16 不输现代 Transformer。图 1 那组 C=60 更直白:DINOv2 0.157、VGG16 0.151、OpenAI CLIP 0.142、SD3-VAE 0.139、Perception Encoder 0.111。
但真正的数字论文没给。 该协议下 |𝒢|=|𝒫|=250、总样本 500,所以随机选点时交集期望 125、并集 375,IoU 的随机基线 ≈ 0.333(超几何分布,标准差约 0.02)。也就是说,论文报告的所有分数都低于随机。这是我按其协议算的,论文全文没提任何 chance level——但它把结论从「对得不好」抬成了「系统性反向」。
图 1 正好给出机制:这些相似度场多是横贯整个圆盘的条带,不是围着参考色收拢的紧致区域。余弦距离被某个全局色度方向主导、局部没有以参考色为中心的极小结构,那它选出的 250 点必然偏向圆盘一侧,与居中的小椭圆系统性错开——低于随机是这种几何的必然结果,不是噪声。
会流到哪些真实工作流
- 感知损失对小色差是结构性失明的。 特征距离在参考色附近没有局部结构,意味着颜色偏一点点几乎不产生梯度——修图、上色、去噪模型的偏色,可能不是数据问题,是损失函数看不见。
- 别拿基础模型特征当色彩保真度的代理。 这直接打在「用 VLM 打分闭环调 ISP」这类做法上:色彩那一维的分数很可能不是从色差来的。前阵子读的 TPIPS 与 Language-based Color ISP Tuning,正是这条线的一头一尾。
- SD3-VAE 排名中下值得单记一笔。 它是 latent diffusion 的入口;latent 空间不保色差,意味着扩散模型做颜色任务时存在一个天然误差地板——你在 latent 里做的色彩控制,落回像素的色差代价是看不见的。
局限与存疑
第一,参照系是 CIEDE2000 算出来的等色差域,不是实测观察者数据。严格讲结论是「模型不像 CIE 标准」,不是「不像人」;文中也没写明用的 ΔE₀₀ 阈值。
第二,刺激是合成、静态、恒亮度的裸色块,无空间上下文。而色恒常与色貌恰恰依赖上下文——拿裸色块去问一个从自然图像学表征的编码器,问在了它的弱项上。
第三,等基数设定(模型辨别域面积被先规定死)让随机基线可算,这是好事;但论文没算,也就没能把「低于随机」这个更强的结论收进去。