这篇有意思的不在网络,而在换了个问题:别人想"怎么弄到更多真值",它想"能不能不要真值"——把缺失的监督信号从数据问题改写成几何问题。

问题:一个像素只测一个波段
快照式多光谱相机靠 MSFA(多光谱滤光片阵列)一次曝光拿到所有波段,代价是每个像素只测一个波长——4×4 的 MSFA 意味着 16 通道里有 15 个是插出来的。而全分辨率光谱真值只能靠推扫式线扫描拍,慢且笨重,跟快照的初衷本身就矛盾。于是长期卡在两头:经典插值不要真值但糊,深度方法清楚但要真值。
转折:用群结构去探零空间
切入点是零空间:只让重建反投影回去对上马赛克测量是不够的,零空间里加任何东西残差都是零。等变成像的思路是造虚拟观测:把重建做个变换、重采样成马赛克、再送回网络,要求它和直接变换重建结果一致。以往用像素平移群,太小;这篇换成相机绕光心转动诱导的射影变换群,pan / tilt / roll 组成的单应变换,平移和旋转都只是子群。群变大,被马赛克吃掉的信息就能捞回更多。
第二块是微调一个叫 RAM(Reconstruct Anything Model)的重建基座:冻住卷积主干,把单通道的输入输出头复制到 16 通道,只训这几层。RAM 只有 32M 参数,是个小基座——可复用的不是规模,而是这条路径:只见过灰度 / RGB 的基座靠改头尾就能接任意通道数。消融也干净(HELICoiD,PSNR):零样本 28.00 → 平移等变 41.77 → 透视等变 44.84,监督天花板 46.83,次好的经典方法 40.98。
赢的是幅值,没赢的是角度
做颜色的人重点看这段。PEFD 的 ERGAS 从 Gaussian 的 6.13 降到 4.46,逐波段相对幅值误差降 27%,全表最好;但同表里 SAM 是 0.042,Gaussian 是 0.034、连加权双线性都有 0.038。HyKo 上更直白:PEFD 的 SAM 是 0.064,跟最朴素的双线性完全持平,Gaussian 是 0.044——PSNR 赢了 2.2 dB,光谱角一点没赢。
也就是说,从零空间捞回来的是空间高频和每个波段的幅值,不是光谱的方向。而对下游来说方向才是载荷:白点估计、CCM 拟合、材质判别吃的都是通道间比例,幅值会被归一化掉。作者只回应说采样光谱曲线跟真值吻合,但那是几条曲线,不是统计量。典型的"重建充分不等于决策充分"——指标挂在 PSNR 上,方法就往锐度上跑。
能进哪些工作流
最直接的落地在多光谱模组:做 MSFA 传感器的团队,最大成本项不是训练,而是配一套推扫系统攒真值,PEFD 只要自己传感器拍的马赛克数据,也不绑定排布。
更值得抄的是监督信号本身——相机自己的运动就是免费的透视变换。手机连拍的手抖、车载的转向、云台的 pan/tilt 本来就在产生同一场景的不同射影视角,任何"采样不足 + 有相机运动"的环节都能搬。再往颜色引一步:三刺激也好、MSFA 也好,本质都是不可逆投影,问"哪些信息掉进了零空间、什么先验能捞回来",比问"网络要不要更深"有价值——同色异谱正是活在零空间里。
局限与存疑
两个出数字的数据集,马赛克都是仿真的。HELICoiD 从推扫高光谱模拟 16 波段;HyKo 更麻烦——它本身就是用 imec / Ximea 的 4×4 快照马赛克相机拍的,全分辨率光谱立方体物理上不可观测,那份"真值"自己就是一次重建的产物,再拿它模拟马赛克,链条是闭环的。唯一的真实传感器实验(imec CMV2K-SSM4x4-VIS)只有定性图,而通道串扰、滤光片不均、暗电流恰是仿真最易漏掉的。
透视等变的增益也不稳定:HELICoiD 上比平移等变多 3 dB,HyKo 上只从 34.47 到 34.81,几乎打平——猜测是车载以平移为主、绕光心的转动少,但论文没验证。而 SAM 的退步只用一张采样光谱图带过;拿去做组织分类或白点估计,0.042 对 0.034 到底意味着什么,才是真正该回答的问题。