🧠 大模型影像论文精读

这里记录大模型与影像系统交叉方向的论文精读。每篇尽量用较少术语讲清楚:它解决了什么影像问题,为什么现在值得看,方法的关键转折在哪里,以及它未来可能怎样进入相机、相册、修图、视频、色彩还原和影像质量评价的真实工作流。

夜景和变焦拍出来的细节,有一部分是猜的:给相机里的生成过程留一个「撤销」
2026-08-17 · Computational Photography · ISP · Generative AI · Image Provenance · Camera Pipeline
arXiv 2026-04(CVPR 2026 Workshop)· 相机端生成式处理的可逆性与图像真实性

手机的夜景模式和数码变焦已经不只是「增强」,而是在生成从未被传感器测到的像素——放大后看清的那串车牌号,可能是模型编的。这篇论文不去阻止相机生成,而是在按下快门那一刻把「生成加了什 …

要去掉玻璃反光,先学会造反光:S2R 把死结解在了数据这一端
2026-08-16 · Diffusion · Video Restoration · Reflection Removal · Data Synthesis · Computational Photography
arXiv 2026-08 · 视频去反光:用物理约束的合成数据训练扩散模型,一步去噪恢复透射层

隔着玻璃拍视频,反光几乎无解——因为没人能同时拍到「有反光」和「一模一样但没反光」的两段素材。小米 MiLM Plus 这篇论文没有硬做去除模型,而是先把「造反光」做成一个可控的生 …

「压得像」不等于「好生成」:V-RAE 用一次插值,测出了视频隐空间里的坑
2026-08-15 · Video Generation · Tokenizer · Representation Learning · Diffusion · Evaluation
arXiv 2026-08 · 视频生成的隐空间表征与压缩

视频生成模型不直接在像素上工作,而是先把视频压成一小串数字(隐空间),再在这串数字上生成。这篇论文指出:这个压缩器一直按「解压后像不像原视频」训练,但这个标准和「好不好生成」几乎不 …

重建三维场景时,别把「这张照片被压过」当成噪声:JSGS 直接读了 JPEG 自带的量化表
2026-08-14 · 3D Gaussian Splatting · Novel View Synthesis · JPEG · DCT · Image Compression
arXiv 2026-08 · 混合压缩质量下的三维高斯重建监督

一堆压缩程度不同的照片重建三维场景时,糊的那几张会把清楚的那几张一起拖下水。JSGS 的做法不是去猜哪里被压坏了,而是读取每个 JPEG 文件里本来就存着的量化表,把「这张图被压掉 …

改完一处,整张图都变了:EditMod 把建模对象从「图像」换成「这一次改动」
2026-08-13 · Image Editing · Visual Autoregressive · Diffusion · Text-Guided Editing
arXiv 2026-08 · 文本指令图像编辑;把编辑从「重画一张」改成「预测一份改动量」

指令编辑的老毛病是改一处、动全图,根因是主流做法本质上在照着原图重画一遍。EditMod 换了个提问方式:在同一个上下文下把原描述和新指令各问一遍模型,两次预测的差就是这条指令真正 …

画面更清楚了,人却认不出来:CodecArena 让大模型当视频编码的裁判
2026-08-12 · Video Compression · Neural Codec · Quality Assessment · Vision-Language Model · Reinforcement Learning
arXiv 2026-08 · 低码率视频编码的画质评价;把编解码器之间的优劣比较交给视觉语言模型来判

低码率下的新一代视频编码器不再传输细节,而是让解码端把细节「编」出来。这类结果在 LPIPS、DISTS 这些主流感知指标上分数很好,但人脸可能换了个人、字幕可能变成鬼画 …

加速让视频模型变得千篇一律:DUET 把两种蒸馏方式分派给两步去噪
2026-08-11 · Video Generation · Diffusion · Distillation · Efficiency
arXiv 2026-08 · 视频扩散少步蒸馏中的质量-多样性权衡

少步蒸馏让视频扩散模型快了,代价是同一句提示词反复生成几乎一样的画面。DUET 的做法不是把两种蒸馏损失混起来调权重,而是按噪声阶段分工:高噪声那一步交给保多样的专家定构图,低噪声 …

颜色重建被改写成了画线:1930 年的彩色胶片,卡住的其实是几何
2026-08-10 · Color Reconstruction · Demosaicing · SFA · Human-in-the-Loop · Film Archive
arXiv 2026-08 · 透镜光栅胶片的颜色重建与人在环校正

Kodacolor 这类透镜光栅胶片把颜色编码成一排排细条纹,还原时最难的不是调色,而是把每条透镜的边界对准。这篇论文干脆把边界做成可编辑的矢量对象,让专家手动纠正后再回灌微调模 …

夜景照片发紫,不是白平衡估错了:把黑电平误差从噪声模型里拆出来
2026-08-09 · RAW · ISP · Color Bias · Low-Light · Denoising
arXiv 2026-07 · 低光去噪后发紫的根因:黑电平误差

低光去噪后暗部发紫,长期被当成白平衡或去噪网络的锅。这篇把根因定位到黑电平误差——一个归一化后被 100–300 倍放大、且逐通道不同的零点偏置,并证明把它塞进噪声模型里一起学反而 …

31 个波段不如 5 个方向:这篇论文把「光谱要多少维」变成了一条能扫出来的曲线
2026-08-08 · Color Constancy · 多光谱 · 光谱降维 · AWB · ISP
arXiv 2026-05 · 光源估计到底需要几维光谱的系统消融

EPFL 这篇没有提新网络,而是把「光源估计到底需要几维光谱」当成自变量系统扫了一遍。结论有点反直觉:在同样是三维的情况下,一组从光源本身学出来的投影基就把角度误差从 7.78° …

相机看不见的那段光谱,人眼看得见:Color Pass-Through 把相机和屏幕当成一个系统来标
2026-08-06 · 色彩还原 · 跨设备一致性 · 同色异谱 · 光谱重建 · ISP
arXiv 2026-07 · 把相机与显示当成一个系统端到端标定

手机拍完在屏上看,和眼睛直接看差一大截。这篇不再分别标定相机和屏幕、中间用 CCM/3D LUT 连起来,而是把两者当成一个耦合系统端到端学;更关键的是它显式补上了「相机三通道完全 …

没有真值也能学去马赛克:PEFD 把相机的一次转身,变成了免费的第二次观测
2026-08-05 · 多光谱 · MSFA · Demosaicing · 自监督 · Foundation Model
arXiv 2026-03 · 无需真值的自监督多光谱 MSFA 去马赛克

快照多光谱相机一个像素只测一个波段,16 通道就有 15/16 是猜的,而监督学习要的真值只能靠又慢又笨的线扫描拿。这篇论文不再想办法凑真值,而是把相机绕光心的转动当成监督信号—— …

50 多个视觉编码器的「色差尺子」:与 CIEDE2000 辨别域的重合度不到 0.25,而随机猜是 0.33
2026-08-03 · Vision Encoder · Color Difference · CIEDE2000 · Perceptual Metric · Color Science
arXiv 2026-07 · 视觉编码器的色差尺子与人类辨别阈的对比

这篇论文没问「模型认不认识颜色」,而是问「模型的色差尺子准不准」:把 50 多个预训练视觉编码器的特征距离,拿去和 CIEDE2000 等色差域算几何重合度(IoU), …

把「颜色被墙改掉」当成噪声:DiffPC 用扩散模型解投影仪的逐像素色彩补偿
2026-08-02 · Diffusion · Color Correction · 跨设备色彩一致性 · Projector-Camera · 逆问题
arXiv 2026-06(TVCG)· 扩散模型做投影仪逐像素色彩补偿

投影仪打到有花纹的墙上,颜色就不是你要的颜色了。DiffPC 没有再训一个补偿网络,而是把「被表面和环境改掉的那部分颜色」直接当作一种噪声,于是补偿变成去噪,用扩散先验做逆问题;条 …

那条裙子为什么会翻:这篇论文把颜色的「二义性」变成了一个能测出来的尖峰
2026-08-01 · Intrinsic Decomposition · Color Constancy · AWB · CLIP · Uncertainty
arXiv 2026-07 · 反照率-光照分解中二义性的可测刻画

同一组 RGB 既可以是「蓝黑裙 + 暖光」,也可以是「白金裙 + 冷光」——这不是模型不够强,是问题本身在某些地方无解。这篇论文的转折在于:它把「哪里会翻」写成了一个有解析形式、 …

AI 修图时会顺手改白平衡,所以先把白平衡从评分里剪掉:3DLP 用一千对实拍 HDR 追问生成模型懂不懂光
2026-07-31 · Diffusion · Image Editing · White Balance · HDR · Benchmark
arXiv 2026-06 · 实拍 HDR 光探针评测生成式修图懂不懂光

海德堡大学与慕尼黑工大的团队实拍了 1000 对「灯开 / 灯关」的高动态范围图像,测生成式修图模型是否真懂光的传播。有意思的是:这些模型会像摄影师一样自作主张地调白平衡和曝光,于 …

「抗光照」和「看得见颜色」是一对会互相拆台的目标
2026-07-28 · VLA · Color Constancy · 数据增广 · 色彩机制 · AWB
arXiv 2026-07 · 颜色增广与光照鲁棒性之间的相互拆台

这篇论文表面是给机器人大模型做光照攻击与防御,真正有价值的发现藏在中间:为了让模型不怕光照变化而做的常规颜色增广,会把模型训练成「色盲」——它学会的不是抗干扰,而是干脆不看颜色。作 …

「像不像」得先问「哪儿像」:TPIPS 用一句话把颜色从感知距离里拆出来
2026-07-27 · VLM · 感知度量 · 色差 · 图像质量评价 · 生成模型评测
arXiv 2026-07 · 可用一句话指定比较维度的感知相似度度量

LPIPS 的作者之一带队,把感知相似度从一个标量拆成「可用自由文本指定维度」的度量:你可以只问「色调像不像」,而不让纹理和构图掺进来。100 万条人类三元组判断显示, …

换探测器不用重训:ΠGDM 把「光谱先验」和「传感器响应」彻底拆开
2026-07-26 · Diffusion · Spectral Reconstruction · Multispectral · Sensor Design · Uncertainty
arXiv 2026-07 · 把光谱先验与传感器响应拆开的光谱重建

这篇不是又训了一个光谱重建网络,而是把「学到的光谱先验」和「探测器的响应度矩阵」拆成两件独立的东西:先验用公开光谱库训一次,换一套探测器只需要换掉物理前向模型里的那个矩阵,不重训。 …

不估光照,先把色卡'画'进画面:GCC 用扩散模型解决跨相机白平衡
2026-07-22 · Diffusion · Color Constancy · AWB · Cross-Camera · ISP
arXiv 2025-02 · 用扩散模型把色卡补画进场景来做白平衡

过去的白平衡是从 RGB 直接回归光源,换台相机就失灵。GCC 反过来:用预训练扩散模型把一张标准色卡’补画’进你拍的场景,再从这张被现场光染过的色卡上读出 …

用一句话拧 ISP 的调色旋钮:Language-based Color ISP Tuning
2026-07-20 · ISP · Color Science · VLM · CLIP · Computational Photography
arXiv 2025-09 · CIC 2025 · 用自然语言调 ISP 的色彩模块

这篇 Sony 的 CIC 2025 短文没有再训一个文本改图模型,而是把 ISP 里的调色块改写成可微的,再让一个 CLIP 式的视觉-语言模型当损失函数,用『happy …

RawGen:把只见过成品图的扩散大模型,反过来'造'RAW
2026-07-19 · Diffusion · RAW · Inverse-ISP · Color Science · AWB
arXiv 2026-04 · 用扩散模型生成 RAW 图像

Michael Brown 组把只在 sRGB 成品图上预训练的扩散大模型反过来用,逼它生成物理上成立的线性 RAW,甚至能凭一句文字为指定相机做 text-to-RAW。这 …

画质评价不再是一个分数:IQA-Spider 让大模型能指着像素说「这里坏了」
2026-07-18 · MLLM · IQA · 画质评价 · Grounding · VLM
arXiv 2026-05 · ICML 2026 · 大模型画质评价,能指出失真在哪

传统图像质量评价把一张照片压成一个分数,工程师拿到 6.2 分却不知道哪坏、为什么坏。IQA-Spider 用一个多模态大模型把画质评价统一成「描述—定位—指认」四件事,还能不额外 …

让大模型先看一眼颜色对不对:VLM-CC 把色彩恒常做成了反馈闭环
2026-07-07 · VLM · Color Constancy · AWB · ISP · Color Restoration
arXiv 2026-05 · 用视觉语言模型做跨相机色彩恒常

VLM-CC 不让大模型直接回归光源颜色,而是先做一次白平衡,再让 VLM 判断画面还偏红、偏绿还是偏蓝,最后把这个语义反馈转成下一轮照明估计。它的价值在于把大模型放到颜色还原的评 …