夜景和变焦拍出来的细节,有一部分是猜的:给相机里的生成过程留一个「撤销」
2026-08-17 · Computational Photography · ISP · Generative AI · Image Provenance · Camera Pipeline
arXiv 2026-04(CVPR 2026 Workshop)· 相机端生成式处理的可逆性与图像真实性
手机的夜景模式和数码变焦已经不只是「增强」,而是在生成从未被传感器测到的像素——放大后看清的那串车牌号,可能是模型编的。这篇论文不去阻止相机生成,而是在按下快门那一刻把「生成加了什 …
要去掉玻璃反光,先学会造反光:S2R 把死结解在了数据这一端
2026-08-16 · Diffusion · Video Restoration · Reflection Removal · Data Synthesis · Computational Photography
arXiv 2026-08 · 视频去反光:用物理约束的合成数据训练扩散模型,一步去噪恢复透射层
隔着玻璃拍视频,反光几乎无解——因为没人能同时拍到「有反光」和「一模一样但没反光」的两段素材。小米 MiLM Plus 这篇论文没有硬做去除模型,而是先把「造反光」做成一个可控的生 …
「压得像」不等于「好生成」:V-RAE 用一次插值,测出了视频隐空间里的坑
2026-08-15 · Video Generation · Tokenizer · Representation Learning · Diffusion · Evaluation
arXiv 2026-08 · 视频生成的隐空间表征与压缩
视频生成模型不直接在像素上工作,而是先把视频压成一小串数字(隐空间),再在这串数字上生成。这篇论文指出:这个压缩器一直按「解压后像不像原视频」训练,但这个标准和「好不好生成」几乎不 …
重建三维场景时,别把「这张照片被压过」当成噪声:JSGS 直接读了 JPEG 自带的量化表
2026-08-14 · 3D Gaussian Splatting · Novel View Synthesis · JPEG · DCT · Image Compression
arXiv 2026-08 · 混合压缩质量下的三维高斯重建监督
一堆压缩程度不同的照片重建三维场景时,糊的那几张会把清楚的那几张一起拖下水。JSGS 的做法不是去猜哪里被压坏了,而是读取每个 JPEG 文件里本来就存着的量化表,把「这张图被压掉 …
改完一处,整张图都变了:EditMod 把建模对象从「图像」换成「这一次改动」
2026-08-13 · Image Editing · Visual Autoregressive · Diffusion · Text-Guided Editing
arXiv 2026-08 · 文本指令图像编辑;把编辑从「重画一张」改成「预测一份改动量」
指令编辑的老毛病是改一处、动全图,根因是主流做法本质上在照着原图重画一遍。EditMod 换了个提问方式:在同一个上下文下把原描述和新指令各问一遍模型,两次预测的差就是这条指令真正 …
画面更清楚了,人却认不出来:CodecArena 让大模型当视频编码的裁判
2026-08-12 · Video Compression · Neural Codec · Quality Assessment · Vision-Language Model · Reinforcement Learning
arXiv 2026-08 · 低码率视频编码的画质评价;把编解码器之间的优劣比较交给视觉语言模型来判
低码率下的新一代视频编码器不再传输细节,而是让解码端把细节「编」出来。这类结果在 LPIPS、DISTS 这些主流感知指标上分数很好,但人脸可能换了个人、字幕可能变成鬼画 …
把「模型懂不懂颜色」变成一局桌游:162 个视觉语言模型,输给了 325 个普通人的共识
2026-08-11 · VLM · Color Naming · Memory Color · Color Science · Benchmark
arXiv 2026-08 · 用色度标定过的桌游测模型与人的颜色共识
这篇论文没有再造一个颜色 benchmark,而是把桌游《Hues and Cues》的 480 格棋盘做了实测色度标定,直接当成一个离散色度空间来用。更关键的是它先用 325 名 …
加速让视频模型变得千篇一律:DUET 把两种蒸馏方式分派给两步去噪
2026-08-11 · Video Generation · Diffusion · Distillation · Efficiency
arXiv 2026-08 · 视频扩散少步蒸馏中的质量-多样性权衡
少步蒸馏让视频扩散模型快了,代价是同一句提示词反复生成几乎一样的画面。DUET 的做法不是把两种蒸馏损失混起来调权重,而是按噪声阶段分工:高噪声那一步交给保多样的专家定构图,低噪声 …
颜色重建被改写成了画线:1930 年的彩色胶片,卡住的其实是几何
2026-08-10 · Color Reconstruction · Demosaicing · SFA · Human-in-the-Loop · Film Archive
arXiv 2026-08 · 透镜光栅胶片的颜色重建与人在环校正
Kodacolor 这类透镜光栅胶片把颜色编码成一排排细条纹,还原时最难的不是调色,而是把每条透镜的边界对准。这篇论文干脆把边界做成可编辑的矢量对象,让专家手动纠正后再回灌微调模 …
夜景照片发紫,不是白平衡估错了:把黑电平误差从噪声模型里拆出来
2026-08-09 · RAW · ISP · Color Bias · Low-Light · Denoising
arXiv 2026-07 · 低光去噪后发紫的根因:黑电平误差
低光去噪后暗部发紫,长期被当成白平衡或去噪网络的锅。这篇把根因定位到黑电平误差——一个归一化后被 100–300 倍放大、且逐通道不同的零点偏置,并证明把它塞进噪声模型里一起学反而 …
31 个波段不如 5 个方向:这篇论文把「光谱要多少维」变成了一条能扫出来的曲线
2026-08-08 · Color Constancy · 多光谱 · 光谱降维 · AWB · ISP
arXiv 2026-05 · 光源估计到底需要几维光谱的系统消融
EPFL 这篇没有提新网络,而是把「光源估计到底需要几维光谱」当成自变量系统扫了一遍。结论有点反直觉:在同样是三维的情况下,一组从光源本身学出来的投影基就把角度误差从 7.78° …
白平衡之后的那一步,还在用两个矩阵插值:C²LUT 把 CCM 换成一张随光源变形的 3D LUT
2026-08-07 · Color Correction · CCM · ISP · 3D LUT · Illuminant
arXiv 2026-07 · 用随光源变形的 3D LUT 取代 CCM 插值
相机把 raw 转成 XYZ 这一步,几十年来一直是「按色温在 D65 和 A 光源两个 3×3 矩阵之间插值」。C²LUT 指出这个设计有两处同时失效:CCT 是一维描述子、装不 …
相机看不见的那段光谱,人眼看得见:Color Pass-Through 把相机和屏幕当成一个系统来标
2026-08-06 · 色彩还原 · 跨设备一致性 · 同色异谱 · 光谱重建 · ISP
arXiv 2026-07 · 把相机与显示当成一个系统端到端标定
手机拍完在屏上看,和眼睛直接看差一大截。这篇不再分别标定相机和屏幕、中间用 CCM/3D LUT 连起来,而是把两者当成一个耦合系统端到端学;更关键的是它显式补上了「相机三通道完全 …
没有真值也能学去马赛克:PEFD 把相机的一次转身,变成了免费的第二次观测
2026-08-05 · 多光谱 · MSFA · Demosaicing · 自监督 · Foundation Model
arXiv 2026-03 · 无需真值的自监督多光谱 MSFA 去马赛克
快照多光谱相机一个像素只测一个波段,16 通道就有 15/16 是猜的,而监督学习要的真值只能靠又慢又笨的线扫描拿。这篇论文不再想办法凑真值,而是把相机绕光心的转动当成监督信号—— …
大模型看的一直是 ISP 的影子:PRISM-VL 把视觉大模型的输入换成 RAW 派生的线性 XYZ
2026-08-04 · VLM · RAW · ISP · Color Science · XYZ
arXiv 2026-05 · 把 VLM 的视觉输入从 sRGB 换成 RAW 派生的线性 XYZ
视觉大模型几乎都在读 ISP 输出的 8-bit sRGB,而这层渲染在模型看到之前就已经把高光截了、把暗部量化了。PRISM-VL 提出把 VLM 的输入换成 RAW …
50 多个视觉编码器的「色差尺子」:与 CIEDE2000 辨别域的重合度不到 0.25,而随机猜是 0.33
2026-08-03 · Vision Encoder · Color Difference · CIEDE2000 · Perceptual Metric · Color Science
arXiv 2026-07 · 视觉编码器的色差尺子与人类辨别阈的对比
这篇论文没问「模型认不认识颜色」,而是问「模型的色差尺子准不准」:把 50 多个预训练视觉编码器的特征距离,拿去和 CIEDE2000 等色差域算几何重合度(IoU), …
把「颜色被墙改掉」当成噪声:DiffPC 用扩散模型解投影仪的逐像素色彩补偿
2026-08-02 · Diffusion · Color Correction · 跨设备色彩一致性 · Projector-Camera · 逆问题
arXiv 2026-06(TVCG)· 扩散模型做投影仪逐像素色彩补偿
投影仪打到有花纹的墙上,颜色就不是你要的颜色了。DiffPC 没有再训一个补偿网络,而是把「被表面和环境改掉的那部分颜色」直接当作一种噪声,于是补偿变成去噪,用扩散先验做逆问题;条 …
那条裙子为什么会翻:这篇论文把颜色的「二义性」变成了一个能测出来的尖峰
2026-08-01 · Intrinsic Decomposition · Color Constancy · AWB · CLIP · Uncertainty
arXiv 2026-07 · 反照率-光照分解中二义性的可测刻画
同一组 RGB 既可以是「蓝黑裙 + 暖光」,也可以是「白金裙 + 冷光」——这不是模型不够强,是问题本身在某些地方无解。这篇论文的转折在于:它把「哪里会翻」写成了一个有解析形式、 …
AI 修图时会顺手改白平衡,所以先把白平衡从评分里剪掉:3DLP 用一千对实拍 HDR 追问生成模型懂不懂光
2026-07-31 · Diffusion · Image Editing · White Balance · HDR · Benchmark
arXiv 2026-06 · 实拍 HDR 光探针评测生成式修图懂不懂光
海德堡大学与慕尼黑工大的团队实拍了 1000 对「灯开 / 灯关」的高动态范围图像,测生成式修图模型是否真懂光的传播。有意思的是:这些模型会像摄影师一样自作主张地调白平衡和曝光,于 …
「风格」不该从语义编码器里读出来:StatLUT 把调色压成三个 Lab 统计量
2026-07-30 · 3D LUT · Color Grading · Diffusion · ISP · Color Science
arXiv 2026-07 · 用三个 Lab 统计量驱动 3D LUT 调色
照片级调色一直靠预训练图像编码器提「风格」,结果把语义也一起提了进来,出现莫名的空间扭曲。StatLUT 干脆不用编码器:只从 CIE Lab 里取三个与空间无关的统计量, …
ΔE 小就够了吗:十一个视觉大模型里,颜色被存成了完全不同的东西
2026-07-29 · VLM · Color Appearance · Color Naming · CIELAB · ISP
arXiv 2026-07 · 视觉大模型内部颜色表征的差异
这篇论文没做白平衡,也没碰 ISP,但它问了一个对 ISP 很致命的问题:当图像的最终消费者是模型而不是人眼,我们习惯用的 CIELAB 几何距离还够不够描述「颜色」。 …
「抗光照」和「看得见颜色」是一对会互相拆台的目标
2026-07-28 · VLA · Color Constancy · 数据增广 · 色彩机制 · AWB
arXiv 2026-07 · 颜色增广与光照鲁棒性之间的相互拆台
这篇论文表面是给机器人大模型做光照攻击与防御,真正有价值的发现藏在中间:为了让模型不怕光照变化而做的常规颜色增广,会把模型训练成「色盲」——它学会的不是抗干扰,而是干脆不看颜色。作 …
「像不像」得先问「哪儿像」:TPIPS 用一句话把颜色从感知距离里拆出来
2026-07-27 · VLM · 感知度量 · 色差 · 图像质量评价 · 生成模型评测
arXiv 2026-07 · 可用一句话指定比较维度的感知相似度度量
LPIPS 的作者之一带队,把感知相似度从一个标量拆成「可用自由文本指定维度」的度量:你可以只问「色调像不像」,而不让纹理和构图掺进来。100 万条人类三元组判断显示, …
换探测器不用重训:ΠGDM 把「光谱先验」和「传感器响应」彻底拆开
2026-07-26 · Diffusion · Spectral Reconstruction · Multispectral · Sensor Design · Uncertainty
arXiv 2026-07 · 把光谱先验与传感器响应拆开的光谱重建
这篇不是又训了一个光谱重建网络,而是把「学到的光谱先验」和「探测器的响应度矩阵」拆成两件独立的东西:先验用公开光谱库训一次,换一套探测器只需要换掉物理前向模型里的那个矩阵,不重训。 …
一台相机一个逆 ISP:SpiralDiff 用一枚 LoRA 让扩散模型学会「按相机还原 RAW」
2026-07-25 · Diffusion · RGB-to-RAW · Inverse ISP · Cross-Camera · White Balance
arXiv 2026-03 · CVPR 2026 · 相机条件下的 RGB→RAW 逆 ISP
把 sRGB 还原成 RAW 从来不是一个逆问题,而是每台相机各一个——因为不同相机的光谱敏感度切出的原始色空间不同。SpiralDiff 把它写成相机条件下的扩散生成, …
别再回归一个光照向量:WaveDiff-CC 把白平衡改写成小波域里的扩散生成
2026-07-24 · Diffusion · Color Constancy · AWB · White Balance · ISP
PRCV 2025 · 在小波域用扩散生成做色彩恒常
WaveDiff-CC 不再把色彩恒常当成’估一个 RGB 光照向量’的回归题,而是用条件扩散模型在小波多尺度域里生成数据驱动的先验,再用动态多头注意力跨尺 …
一张 RGB 到底藏着几条光谱?R2H-Diff 用扩散模型把'说不准'本身建模出来
2026-07-23 · Diffusion · Spectral Reconstruction · Hyperspectral · ISP · Color
arXiv 2026-05 · 扩散模型做 RGB 到高光谱的重建
RGB 反推光谱是个欠定逆问题——同一组 RGB 可能对应无数条光谱曲线。R2H-Diff 不再用回归给一个’平均答案’,而是用条件扩散模型把这条曲线的整个 …
不估光照,先把色卡'画'进画面:GCC 用扩散模型解决跨相机白平衡
2026-07-22 · Diffusion · Color Constancy · AWB · Cross-Camera · ISP
arXiv 2025-02 · 用扩散模型把色卡补画进场景来做白平衡
过去的白平衡是从 RGB 直接回归光源,换台相机就失灵。GCC 反过来:用预训练扩散模型把一张标准色卡’补画’进你拍的场景,再从这张被现场光染过的色卡上读出 …
把「会推理的修图」塞进手机:VeraRetouch 用 0.5B 小模型 + 可微调色渲染器闭环
2026-07-21 · VLM · Photo Retouching · Differentiable ISP · Color Grading · On-device
arXiv 2026-04 · 端上可微渲染器闭环的推理式修图调色
近一年修图 agent 的主流是让 MLLM 去点 Lightroom 的 200 多个按钮,但外部软件不可微,整条链路没法端到端训。VeraRetouch 换了个思路:0.5B …
用一句话拧 ISP 的调色旋钮:Language-based Color ISP Tuning
2026-07-20 · ISP · Color Science · VLM · CLIP · Computational Photography
arXiv 2025-09 · CIC 2025 · 用自然语言调 ISP 的色彩模块
这篇 Sony 的 CIC 2025 短文没有再训一个文本改图模型,而是把 ISP 里的调色块改写成可微的,再让一个 CLIP 式的视觉-语言模型当损失函数,用『happy …
RawGen:把只见过成品图的扩散大模型,反过来'造'RAW
2026-07-19 · Diffusion · RAW · Inverse-ISP · Color Science · AWB
arXiv 2026-04 · 用扩散模型生成 RAW 图像
Michael Brown 组把只在 sRGB 成品图上预训练的扩散大模型反过来用,逼它生成物理上成立的线性 RAW,甚至能凭一句文字为指定相机做 text-to-RAW。这 …
画质评价不再是一个分数:IQA-Spider 让大模型能指着像素说「这里坏了」
2026-07-18 · MLLM · IQA · 画质评价 · Grounding · VLM
arXiv 2026-05 · ICML 2026 · 大模型画质评价,能指出失真在哪
传统图像质量评价把一张照片压成一个分数,工程师拿到 6.2 分却不知道哪坏、为什么坏。IQA-Spider 用一个多模态大模型把画质评价统一成「描述—定位—指认」四件事,还能不额外 …
让大模型先看一眼颜色对不对:VLM-CC 把色彩恒常做成了反馈闭环
2026-07-07 · VLM · Color Constancy · AWB · ISP · Color Restoration
arXiv 2026-05 · 用视觉语言模型做跨相机色彩恒常
VLM-CC 不让大模型直接回归光源颜色,而是先做一次白平衡,再让 VLM 判断画面还偏红、偏绿还是偏蓝,最后把这个语义反馈转成下一轮照明估计。它的价值在于把大模型放到颜色还原的评 …