ΔE 小就够了吗:十一个视觉大模型里,颜色被存成了完全不同的东西

🧠 大模型影像论文精读 · 2026-07-29 · VLM · Color Appearance · Color Naming · CIELAB · ISP
arXiv 2026-07 · 色彩/ISP 相关
图片来源:Igali & Shamoi, arXiv:2607.13647

有意思的地方不在结论,在它换的那把尺子。

以往问「模型懂不懂颜色」,通常是拿 CIELAB 当标准答案:把模型嵌入两两求距离,和 ΔE00 的距离排个序,相关性高就算懂。这套做法测的是感知距离。但人不是这么组织颜色的——人把颜色归进一堆边界模糊、互相重叠的名字里,一个色可以「有点红、有点暗红、又有点灰」。

Igali 和 Shamoi 这篇(arXiv:2607.13647,7 月 15 日)把参照系换成了 COLIBRI——基于 2496 人问卷拟合的模糊颜色模型,9 色相 × 4 饱和度 × 3 明度共 86 类,每个颜色不是一个标签,而是一个 86 维隶属度向量。刺激是 World Color Survey 的 330 个 Munsell 色卡,渲成平面色块和带明暗球体两种。

https://arxiv.org/html/2607.13647v1/colibri_color.png

关键的一步:把几何「减掉」

真正让这篇站住的,是它没有满足于「模型和 COLIBRI 相关性 0.67」。因为 COLIBRI 本身就跟 CIELAB 高度相关,这个 0.67 里有多少只是普通的色差几何?作者做了一个偏相关:在控制住 CIEDE2000 距离矩阵之后,再看模型和人类模糊结构还剩多少一致,记作 pΔ。

结果分成两半。范畴层面分不出高下——十一个编码器的 ARI 和轮廓系数区间互相重叠。但减掉几何之后差距一下拉开:两个 MAE(掩码重建)拿到 pΔ ≈ 0.46–0.47,置信区间和其余所有模型都不重叠;最好的非 MAE 模型只有 0.28;OpenCLIP-L 则是 −0.03,区间跨零,等于说它在色差几何之外基本没剩下什么与人类一致的东西。有意思的是 MAE 的轮廓系数反而偏低——它不是靠把类聚得更紧赢的,是靠渐变结构本身。

作者对「为什么是 MAE」很克制:这十一个模型的训练数据、规模、patch 大小、配方全都不同,所以他们只说这是与训练范式的关联,不是目标函数的因果效应。合理的猜想是重建目标必须保住低层细节,而颜色恰好是这种属性。这个态度值得抄。

第二个实验更直白。在 MegaCOIN 自然图上分别探测「前景物体颜色」和「背景颜色」:语言监督模型的前景优势 Δ 有 +0.12 到 +0.14,类别监督和自蒸馏 +0.07 到 +0.11,MAE 是 +0.00 和 +0.02。CLIP 一类模型把颜色绑在了它认出来的那个物体上,MAE 保留的则是整图的表面颜色。逐层看也一致:语言监督这条线从浅层一路往输出端衰减,只有 MAE 不掉。

能往影像里迁移什么

先说清楚:作者全程没提 ISP、没提白平衡,下面三条是我的外推。

第一,pΔ 这个量本身就是个警告。 它能不为零,说明「色差几何」和「模型内部的颜色组织」是可分离的两件事。当照片的最终消费者不再是人眼,而是相册检索、AI 修图、机器视觉前端时,把 ΔE00 压小就不再是充分的调校目标——你压的是几何,模型吃的是几何之外那部分。方向还有点反直觉:这里恰恰是重建目标的模型把颜色留住了。

第二,选 backbone 要看任务的空间尺度。 AWB 估的是全局光照,而语言监督编码器被测出来是把颜色往前景物体上收。用 CLIP 特征做全局光照估计,结构上就和任务错配——这不是类比,是这篇量出来的数。反过来做分区光照 / 多光源 mask,那种物体绑定性也许才是想要的。

第三,做 VLM 颜色评价器别只看一个分数。 ARI 排出来的名次和 pΔ 排出来的名次不是一回事,一个「颜色理解能力」总分会同时掩盖范畴能力和渐变能力。

局限与存疑

得压着看。这是投 SCIS&ISIS 2026 的 6 页短文,不是顶会结果。330 个色卡只覆盖 86 个范畴里的 50 个作为主导标签,样本彼此不独立;自然图实验用整图嵌入、没有物体掩码,「前景颜色」其实混着背景;所有模型都是 ViT 家族。最大的坑还是那个混淆:MAE 赢在目标函数还是赢在训练数据和 patch 尺寸,作者自己也承认分不开。要拿它当选型依据,得先有人做一次控制变量的复现。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读