扩散模型一定要用 U-Net 吗?DiT 把去噪交给 Transformer
2026-09-28 · Diffusion · Image Generation · Transformer · Latent Space
ICCV 2023 · 用 Transformer 替换图像扩散模型的去噪骨架
DiT 追问:生成图片时,负责一步步去噪的网络是否非得是 U-Net?作者把压缩后的图像切成小块交给 Transformer,并观察到计算投入与生成质量之间清晰的关系。它为后续图像 …
镜头转回来,街道还是那条街:给视频生成模型一份空间记忆
2026-09-27 · Video Generation · World Model · Spatial Memory · 3D Geometry
arXiv 2025-06 · 用空间记忆改善长视频生成的场景一致性
视频模型往前生成时,常会忘记镜头刚才经过的地方,折返后把同一条街画成另一条。论文把场景的固定结构存进可更新的三维地图,再用近期画面和少量旧画面补足运动与细节;实验显示折返时更能认出 …
画图不必一步步擦噪声:LCM 把漫长生成压成几次跳跃
2026-09-26 · Image Generation · Diffusion · Model Distillation · Efficient Inference
arXiv 2023-10 · 将文生图扩散模型蒸馏为少步生成模型
扩散模型通常要反复去噪才能画出一张图,修改提示词后的等待会打断创作。LCM 让学生模型学习从生成过程的不同位置直接抵达同一结果,论文展示了两到四步的高分辨率文生图;它改善的是生成步 …
生成高清图,先把底稿折得更小:DC-AE 重做扩散模型的压缩入口
2026-09-26 · Diffusion · Autoencoder · Latent Representation · Image Generation
ICLR 2025 · 用深度压缩的图像表征加速高清扩散生成
高清图生成的开销,很大一部分取决于模型要处理多大的中间底稿。DC-AE 重新设计这份底稿的压缩与还原方式,让扩散模型在更小的空间里作画,同时尽量保住图像细节。
挑训练图文,不能只看单张好不好:JEST 把数据选择变成组队题
2026-09-26 · Data Curation · Multimodal Learning · Image-Text · Contrastive Learning
arXiv 2024-06 · 图文模型预训练中的成组数据选择
训练看图大模型时,逐张挑出高质量图片和文字,未必能组成好的一堂课。JEST 根据一组图文之间的相互关系选训练批次,让模型把算力花在更能学到东西的组合上。
改一个词,为什么整张图不必重画:Prompt-to-Prompt 把注意力图变成修图轨道
2026-09-25 · Diffusion · Image Editing · Cross-Attention · Text-to-Image
arXiv 2022-08 · 通过交叉注意力控制保持构图的文本图像编辑
Prompt-to-Prompt 不另训修图模型,而是在扩散生成过程中复用原图的词语—位置关系,让改提示词不再等于整张重画。它奠定了免掩膜、免训练的注意力控制路线,但真实照片仍受反 …
没在名单里的东西,也能被一句话圈出来:Grounding DINO 把目标检测改成了搜索题
2026-09-24 · Vision-Language Model · Open-Set Detection · Visual Grounding · Image Understanding
ECCV 2024 · 用自然语言指定任意目标的开放集检测
传统目标检测器像只会按固定名单点名,换一个没训练过的物体就可能失灵。Grounding DINO 把语言和图像定位贯穿检测流程,让一句描述直接变成可供选区、检索和自动标注使用的方 …
修图不是重新画一遍:SUPIR 给扩散模型拴上一根保真绳
2026-09-23 · Diffusion · Image Restoration · Super-Resolution · Multimodal
CVPR 2024 · 用大规模扩散先验、图文理解与保真采样处理真实图像复原
SUPIR 把真实照片复原从固定退化的像素回归,推向受原图约束的大模型生成。它能补出更自然的纹理,也把生成式修复最难回避的“好看还是可信”变成了一个可调但尚未解决的产品问题。
别逼大模型直接打 3.7 分:Q-Align 先学会说“好”与“差”
2026-09-22 · IQA · VQA · Multimodal Models · Human Preference
arXiv 2023-12 · 用文字等级对齐图像、视频与审美评分
Q-Align 没让多模态大模型直接回归画质分数,而是先学习人类熟悉的五档评价,再从各档概率还原连续分数。这个看似退一步的设计,反而让同一模型能够处理图像质量、审美和视频质量,并改 …
一张商品照看不见背面:SV3D 把视频的连贯性借给三维重建
2026-09-21 · Video Diffusion · 3D Generation · Novel View Synthesis · NeRF
ECCV 2024 · 用视频扩散模型生成相机可控的一致多视图,并据此重建三维物体
从一张照片恢复三维物体,最难的不是画出背面,而是让所有角度讲同一个故事。SV3D 把视频模型维持前后帧连贯的能力改造成多视角一致性,再用这些合成视图搭出可渲染的三维模型。
文字说不清姿势,就直接画给模型看:ControlNet 给扩散模型装上空间控制杆
2026-09-20 · Diffusion · Controllable Generation · Text-to-Image · Spatial Control
arXiv 2023-02 · 为预训练文生图扩散模型增加可复用的空间条件控制
ControlNet 不再让用户只靠文字反复碰运气,而是让边缘、人体姿态、深度图等结构直接约束生成画面。它冻结原有扩散模型,再用一份可训练副本学习新控制,因此能保住底座能力,同时接 …
世界模型别只会续写像素:Puffin-World 把重力、深度和相机一起写进世界
2026-09-19 · World Model · 3D Generation · Novel View Synthesis · Camera Geometry
arXiv 2026-09 · 联合建模相机物理、场景几何与外观的三维世界模型
许多世界模型会生成下一张好看的画面,却没有明确保存哪里是上、镜头朝哪、物体离相机多远。Puffin-World 把重力方向、深度和 RGB 外观放进同一套生成系统,让看图、换机位和 …
走路别走着走着换了节奏:Lumiere 让整段视频一起学会动
2026-09-16 · 视频生成 · 扩散模型 · 时序一致性 · 图生视频
arXiv 2024-01 · 联合建模整段视频的运动与时序一致性
几张漂亮的关键画面,未必能补成一段连贯的动作。Lumiere 把整段视频放进同一个生成过程,让模型同时协调前后的运动,再分段补足画面细节。
修图只说要改哪里:InstructPix2Pix 把前后对照变成指令课本
2026-09-15 · Image Editing · Diffusion · Instruction Following · Synthetic Data
arXiv 2022-11 · 用合成前后图像对训练自然语言指令编辑
想把照片里的马换成龙,不该还得把整张照片重新描述一遍。InstructPix2Pix 让语言模型与画图模型先制作编辑课本,再训练一个直接听指令修图的模型;难点仍是改对目标,同时保住 …
一张图不必占满一张网格:TiTok 把生成模型的底稿缩成 32 个编码
2026-09-14 · 图像表征 · 视觉分词 · 图像生成 · Transformer
arXiv 2024-06 · 面向图像重建与生成的一维紧凑表征
图像是二维的,生成模型的内部底稿也必须是二维吗?TiTok 用一小串可学习的编码汇总整张图,让模型少预测许多位置,同时揭示了保存细节与方便生成之间的取舍。
点一下,到底选袖子还是整个人?SAM 把选区做成了可提示的通用能力
2026-09-13 · 图像分割 · 视觉基础模型 · 交互式影像 · 提示学习
arXiv 2023-04 · 通过点和框提示生成物体选区的视觉基础模型
点击衣袖,用户可能想选袖子,也可能想选整个人。SAM 允许同一个提示对应多个合理选区,把分割做成可以反复调用的通用能力;它的边界也很明确:选出物体不等于懂得怎样修图。
先擦干净,再补细节:DiffBIR 把生成式修复拆成两份工作
2026-09-12 · 图像复原 · 扩散模型 · 超分辨率 · 生成式修复
arXiv 2023-08 · 利用预训练扩散模型进行两阶段盲图像复原
旧照片里的噪点和纹理混在一起,生成模型可能把两者都当成值得保留的内容。DiffBIR 先清理退化,再借文生图模型补细节,并允许调节生成结果对清理后图像的贴合程度。
手机各有各的算力,模型不必各练一遍:SnapGen++ 把文生图做成可选大小的套装
2026-09-11 · 端上推理 · 模型蒸馏 · 文生图 · 稀疏注意力
arXiv 2026-01 · 面向手机与边缘设备的高效文生图模型
SnapGen++ 在一套共享权重里共同训练大小不同的生成模型,让不同设备选择合适版本。它把看全局、补细节和减少生成步骤一起设计;手机演示已做到秒级出图,但相册修图与持续运行仍是下 …
画图何必从左写到右:VAR 把预测下一块,改成预测下一层细节
2026-09-10 · Image Generation · Autoregressive Modeling · Multi-Scale
arXiv 2024-04 · 以逐尺度预测实现自回归图像生成
VAR 把图像生成的顺序从逐块接龙,改成先搭整体、再逐层补细节。同一层可以一起预测,让语言大模型式的生成路线重新具备竞争力,但原论文的成绩仍限于类别条件图像生成。
先别决定导出什么格式:TRELLIS 给三维生成做了一份共同底稿
2026-09-09 · 3D Generation · Structured Latents · Flow Matching · Image-to-3D
CVPR 2025 · 用统一结构化表示支持多种格式的三维资产生成
TRELLIS 把三维物体压成一份带空间位置的共同底稿,再按用途解码成不同格式。它让生成与局部修改有了共同基础,但照片里的阴影和高光仍可能被一起带进模型。
世界模型缺的不是更多视频,而是「每一帧为什么会变」
2026-09-08 · World Model · Video Generation · Synthetic Data · Unreal Engine
arXiv 2026-09 · 面向动作条件视频生成的合成数据生产系统
普通视频只记录画面怎样变化,却常常丢了是谁做了什么。作者把实时物理与高质量渲染拆成前后两段,批量生产逐帧对齐的动作、相机状态和多视角视频;真正的悬念是,这些看起来漂亮的数据是否真的 …
速度测不了,就测谁先到底:Principia 把视频生成的物理考试改写成与相机无关的关系题
2026-09-07 · Video Generation · Evaluation · World Models · Benchmark
arXiv 2026-09 · 视频生成模型的物理一致性评测;用标定无关的关系一致性给六个主流视频生成模型打物理分
六个主流视频生成模型在画质榜 VBench 上都是 0.8 上下,在 Principia 的物理考试里最高只拿 0.42。它的解法是不测绝对速度——改测同一场景里两个物体之间必须成 …
在照片上涂两笔就能改光:Dior 给随手涂鸦加上了亮度和颜色的刻度
2026-09-06 · Image Editing · Relighting · Diffusion · Illumination
arXiv 2026-08 · 涂鸦驱动的图像重打光:用一张与材质解耦的「Lumi Map」给画笔定标
改光一直比改颜色难:文字描述靠模型猜,涂鸦只能标个位置。Dior 造了一个中间表示 Lumi Map——把场景想象成白墙后光源直接照出的那张图——让每一笔涂鸦的数值与颜色都有了确定 …
别给大模型换眼睛:把多光谱和雷达,翻译成它本来就认识的六张图
2026-09-05 · VLM · Multispectral · SAR · LoRA · Remote Sensing
arXiv 2026-09 · 多光谱/雷达观测接入通用视觉大模型的轻量适配协议
给通用视觉大模型喂多光谱和雷达数据,通常要为每种传感器定制编码器再重新预训练。这篇论文把一次观测渲染成六张有名字的普通图,走模型原有的多图接口,再用一轮 LoRA 轻量适配;四个架 …
修图也能「多想几步」:ResFlow-Tuner 把大模型的推理时扩展搬进影像复原
2026-09-05 · Image Restoration · Diffusion · Test-Time Scaling · Flow Matching · Reward Model
arXiv 2026-03 · 真实场景图像复原的推理时扩展(test-time scaling)
把大语言模型圈「推理时多花算力换更好结果」的思路搬进真实场景图像复原:同一个 120 亿参数文生图底座,在去噪过程中铺开候选、由三个打分器择优,画质随算力按需上涨。代价是约 15 …
镜头不再为人眼设计:CODA 把视觉大模型变成镜头的评价函数
2026-09-04 · Meta-Optics · Computational Imaging · Vision-Language Model · End-to-End Optics · CLIP
arXiv 2026-06 · 面向冻结视觉大模型的超表面镜头协同设计
超薄超表面镜头成像一塌糊涂,传统补救是后面接个修图网络;CODA 干脆什么都不修,把冻结的 CLIP 的分类误差一路反传回镜头结构,直接为模型设计镜头。同一颗受限镜头,零样本识别率 …
视频世界模型会「演」,不会「记」:五个杯子换十次,球在哪全靠猜
2026-09-04 · Video Generation · World Model · State Tracking · Linear Attention · Architecture
arXiv 2026-08 · 视频世界模型的状态记忆分析:生成画面逼真,不代表模型记住了看不见的世界状态
把街头戏法「三仙归洞」搬进视频生成模型:训练只看 5 次交换、测试加到 30 次,主流架构生成的画面依旧逼真,掀杯答对率却跌到瞎猜水平。论文指出根因是像素级训练目标从不监督看不见的 …
码率压到底、细节靠现场『想』:VoRTeC 把视频生成大模型改造成实时解码器
2026-09-04 · Video Compression · Flow Matching · Video Generation · Latent Representation
arXiv 2026-09 · 基于视频生成大模型的实时生成式视频压缩
超低码率下传统编码把画面压糊,生成式压缩又慢得没法用。VoRTeC 冻结视频生成大模型 Wan2.1,先估计压缩损伤落在生成路径哪一步、再一步到位重建, …
画图、改图、认实体一个全包:通用图像生成的胜负手,正在从架构挪向数据
2026-09-04 · Image Generation · Training Data · Image Editing · Diffusion
arXiv 2026-08 · 通用图像生成模型的训练数据基础设施:文生图、图像编辑与世界知识接地的统一数据设计
阿里巴巴团队从零训练了 3B 和 6B 两个多模态扩散模型,但论文真正的主角是数据:三套按「能力」拆开的数据引擎、说同一种语言的自动标注系统,外加一个盯着模型短板反复出题的评估闭 …
生成式放大总在编细节:GraftSR 让 AI 先去图库里找「同一件」
2026-09-04 · Super-Resolution · Diffusion · Reference-based Restoration · VLM
arXiv 2026-08 · 同实例参考引导的图像超分辨率
生成式超分补出来的细节是模型编的,GraftSR 改成从同一件物品的其它高清照片里借真纹理:视觉大模型点名、分割模型抠图,双掩码拆解「取什么、贴哪里」,在 14.1 万组电商同实例 …
把解码器换成视频生成大模型:VoRTeC 让生成式视频压缩第一次跑进实时
2026-09-04 · Video Compression · Neural Codec · Flow Matching · Foundation Model
arXiv 2026-09 · 建立在视频生成基础模型上的实时生成式视频压缩
视频压得很狠时会糊成平均脸,靠生成模型补细节又慢到没法用。VoRTeC 把开源视频生成模型 Wan2.1 直接当解码器:把压缩码看成生成路径中段的一个含噪状态,一步走完剩下的 …
把视频生成模型压到 3 比特,画面先「变肉」:DSAQuant 让压缩跟着去噪阶段分工
2026-09-04 · Quantization · Video Generation · Diffusion · On-Device · Efficiency
arXiv 2026-09 · 视频扩散模型的低比特量化感知训练:保住结构、找回细节的端侧压缩配方
视频生成模型压到 3 比特后,构图和运动都还在,丢的偏偏是纹理和锐度。DSAQuant 的答案是:去噪的早晚两段干的是不同的活,量化却一视同仁——训练时先照抄全精度老师再切回原生目 …
原图不出手机,上传的是压缩过的「理解」——把视觉大模型的中间特征编成码流
2026-09-04 · VLM · Neural Network Coding · Edge-Cloud Inference · Compression
arXiv 2026-09 · 端云分割推理下视觉大模型中间特征的标准化压缩与「码率-任务」权衡
当大模型的「看」跑在设备上、「想」跑在云端,中间那串视觉 token 就成了要在网络上传输的数据。这篇论文用现成的国际编码标准把它压掉 98%,视频问答精度几乎不变,直到某个点再压 …
压到 4 bit 掉细节,不是所有步都有份:DSAQuant 把量化对齐到去噪阶段
2026-09-04 · Quantization · Video Generation · Diffusion Model · Efficient Inference
arXiv 2026-09 · 视频生成模型的量化压缩:按去噪阶段分配训练监督与推理策略
视频生成模型压到 4-bit,结构和动作都在、细节却死了。这篇论文用一组替换实验把伤害定位到去噪后段,再给出两处修改:训练时按阶段切换监督, …
别让大模型画图,让它猜数字:FLM 把图像压缩改写成「预测下一个系数」
2026-09-04 · Image Compression · LLM · Entropy Coding · JPEG · Autoregressive
arXiv 2026-08 · 图像压缩 × 语言模型:用下一系数预测替代生成式重建,兼顾低码率与保真
生成式压缩把码率压得极低,代价是细节由模型编造。FLM 请大模型进压缩管线却不让它画图,只让它预测 DCT 系数的概率、喂给算术编码器:图像零改动,Kodak 上同画质省一半码率, …
别再把像素当文字:LUMI 让冻结的语言大模型直接压图,一比特不差
2026-09-04 · Lossless Compression · LLM · Tokenizer · Arithmetic Coding · Image Codec
arXiv 2026-07 · 冻结语言大模型的无损图像压缩(免 tokenizer 接口)
语言大模型的正门是 tokenizer,为文字设计;LUMI 把像素描述子直接写进模型 embedding 入口,用冻结骨干当概率引擎、256 路预测头驱动算术编码, …
别再借文生图的地基:PixRestore 把万能修图搬回像素空间,一步出图
2026-09-04 · Diffusion · Image Restoration · Flow Matching · DiT · On-Device
arXiv 2026-08 · 统一图像复原(一个模型同时修多种退化)的像素空间一步扩散方案
主流『万能修图』都在文生图扩散模型的隐空间里做文章,PixRestore 反其道:不用 VAE、不用文生图预训练,从零在像素空间训一个扩散 Transformer,再蒸馏成一步出 …
修图不需要先会画画:PixRestore 把扩散从潜空间搬回像素
2026-09-04 · Image Restoration · Diffusion · Pixel Space · Unified Model
arXiv 2026-08 · 统一图像复原:一个模型同时处理八种退化,主张复原不必依赖文生图生成先验
主流做法是把文生图大模型改造成修图器,PixRestore 反着走:不用 VAE、不用文生图预训练,直接在像素上从头训一个约 50M 参数的复原底座,一步出图、44 毫秒一张。它用 …
一张照片同时有雨丝、雾和噪点:这个模型先画「病灶图」,再逐像素开药方
2026-09-04 · Image Restoration · All-in-One · Multimodal Prompt · Low-Level Vision
arXiv 2026-08 · 全一图像复原的像素级多模态引导(ACM MM 2026 Oral)
全一复原模型过去给整张图配同一份策略,病判成雾就整图按雾治。MGN-AIR 让模型先估计一张逐像素的退化强度图,再与文本提示合成每个像素自己的处理配方,雨、雾、噪点混在一张图里也能 …
AI 修复装在 ISP 前还是后:把「先修 RAW 还是后修照片」的口水仗做成受控实验
2026-09-04 · Image Restoration · ISP · Computational Photography · Benchmark
arXiv 2026-09 · 手机成像流水线中 AI 修复的摆放基准:在固定 ISP 前修 RAW 与在后修 sRGB 的受控对比
围绕固定的图像信号处理器,这篇基准系统比较「先修 RAW 再进 ISP」和「先出照片再修」两种摆放,覆盖四款手机、两种学习型 ISP、三种退化。结论反直觉:胜负手不是 RAW …
文生图装不下一次日落:把一张线性图拆成四张曝光包围,让模型直接生成「现场光」
2026-09-03 · Diffusion · Text-to-Image · RAW · HDR · Computational Photography
arXiv 2026-04(CVPR 2026)· 文生图向场景线性域的扩展:用曝光包围表征生成高动态范围、可后期的线性图像
文生图模型交付的从来都是调过味的成品图,高光一旦压掉就救不回来。这篇把一张高动态范围线性图拆成四张普通曝光图来生成,让模型第一次直接产出能进专业后期流程的「数码底片」。
把「看多大」做成旋钮:修夜景的扩散模型吃下了 4K 整图
2026-09-03 · Diffusion · Low-light Enhancement · Image Restoration · Computational Photography
arXiv 2026-09(IJCV 2026 接收)· 低光图像增强的可扩展扩散模型
扩散模型修夜景细节最自然,但整图一进 4K 就爆显存;切成小块又各亮各的。P-PatchDiff 把去噪时的窗口大小做成随步数伸缩的调度,再给每块配一张全局亮度地图,4K …
图片压缩有了新收件人:视觉 token 压掉 98%,大模型照样看懂
2026-09-03 · Neural Network Coding · Visual Token · VLM · Split Inference · Compression
arXiv 2026-09 · 端云拆分推理中视觉 token 的标准化压缩(AI traffic)
大模型看视频可以只传『它看到的东西』:手机跑视觉编码器,把内部视觉 token 发给云端语言模型。论文用现成的 ISO/IEC 15938-17 …
压的不是画面,是模型「看懂的东西」:视觉特征砍掉 98%,答题几乎不掉分
2026-09-03 · Neural Compression · Coding for Machines · VLM · Split Inference
arXiv 2026-09 · 端云分工视觉语言模型的中间特征标准化压缩(coding for machines)
当视觉编码器在设备端、语言模型在云端,中间传输的不再是视频,而是一串特征。作者用现成的国际标准编解码器把这套特征压掉 98%,视频问答几乎不掉分——并由此主张:给模型消费的数据做压 …
压掉 98% 还不崩:大模型眼里的画面,需要自己的码流格式
2026-09-03 · Neural Compression · VLM · Split Inference · On-Device AI · Rate-Task Optimization
arXiv 2026-09 · 视觉 token 的标准化压缩传输:给 split 推理立一条「码率-任务」曲线
当视觉编码器在手机端、语言模型在云端,中间那串视觉 token 就成了要上网传输的载荷。这篇论文用 MPEG 已标准化的神经网络编码(NNC)直接压 Qwen3-VL 的完整视觉接 …
压掉 98% 的比特,大模型照样看懂:当 AI 流量需要自己的 JPEG
2026-09-03 · Neural Network Coding · Compression · Vision-Language Model · Edge-Cloud Inference · Token
arXiv 2026-09 · 拆分式视觉-语言推理中「AI 流量」(视觉 token 张量)的标准编码与任务鲁棒性测量
设备端把画面变成大模型的中间特征再传给云端,这类「AI 流量」此前没有自己的编码标准。作者用 MPEG 神经网络编码标准压掉 98% 比特,视频问答准确率几乎不掉——因为模型读的是 …
别再拿文生视频模型当解码器:GenVC 训出第一个专为压缩而生的视频扩散模型
2026-09-03 · Video Compression · Diffusion Model · Generative Codec · Distillation
arXiv 2026-07 · 面向超低码率的生成式视频编码;首个为压缩目标从零训练的视频扩散模型
极低码率下的视频解码正被生成模型接管,但现有方案几乎都是拿文生视频模型改装。GenVC 从零训练了一个只为压缩服务的视频扩散模型,还诊断并修好了蒸馏成单步时『画面清晰但运动冻住』的 …
别再借文生图的隐空间修图:PixRestore 把图像复原搬回像素空间
2026-09-03 · Image Restoration · Diffusion Transformer · Pixel Space · Model Distillation
arXiv 2026-08 · 统一图像复原:从零训练、直接在像素空间工作的扩散 Transformer
复原模型惯用的文生图底座自带一个有损压缩器,细节天花板被写死在隐空间。PixRestore 扔掉底座和压缩器,从零训练一个像素空间的扩散 Transformer,用逐层可信度自动分 …
别再借文生图底座修图了:PixRestore 证明复原需要的是细节,不是想象力
2026-09-03 · Image Restoration · Diffusion Transformer · Vision Foundation Model · One-Step Generation
arXiv 2026-08 · 统一图像复原:一个模型处理模糊、雨雪、雾、暗光、超分等多类退化
文生图大模型是这两年图像复原的默认底座,PixRestore 反其道而行:不要 VAE、不要文生图先验,直接在像素上从头训一个五千多万参数的扩散 transformer,一步出图。 …
别从噪声开始解码:VoRTeC 把视频码流当成生成轨迹上的一个中途站
2026-09-03 · Video Compression · Flow Matching · Diffusion · Neural Codec · Video Generation
arXiv 2026-09 · 生成式视频压缩:拿视频生成基础模型做一步实时解码
生成式视频压缩画质惊艳,但解码要从噪声迭代几十步,慢到没法用。VoRTeC 把压缩码流看成视频生成模型流匹配轨迹上的一个中途站,解码只需沿轨迹往回走一步:同等观感省 58% 码率, …
Tokenizer 好不好,别再训一遍才知道:AffineTok 把它变成一个能直接测的数
2026-09-03 · Tokenizer · Diffusion · Latent Representation · Image Generation
arXiv 2026-08 · 视觉 tokenizer 的语义一致性度量与扩散友好度训练改进
判断一个视觉 tokenizer 好不好,以往只能接上生成模型从头训一遍看分数。AffineTok 发现这一年的语义监督对齐错了对象,并把『是否利于扩散』压缩成一个不用训练就能测的 …
AI 降噪放在 ISP 前还是后?位置不背锅,见没见过这台相机才是胜负手
2026-09-03 · ISP · Image Restoration · RAW · Benchmark · 计算摄影
arXiv 2026-09(BMVC 2026)· 相机流水线中 RAW 端与 RGB 端修复位置的受控对比基准
把「AI 修复该装在相机流水线哪一端」做成受控实验:ISP 全程冻结成黑盒,只动修复位置和训练分布。结果是位置不决定胜负——RAW 修复能打赢通用模型,但真正最强的是放在成片端、却 …
「修得对」和「编得美」不用再二选一:PixelIR 把超分拆成两条流
2026-09-03 · Super-Resolution · Flow Matching · Diffusion · Image Restoration
arXiv 2026-08 · 真实世界图像超分;把保真与感知分配给两条独立的流匹配路径,再一步蒸馏到可部署规模
超分模型的保真与感知长期互相牵制。PixelIR 用一条图像流专管修对、一条残差流专管编细节,相加成图,再蒸馏成一步、3290 万参数的学生——在真实超分基准上同时拿下两类指标。
重画一遍,水印就没了:AI 编辑器的「重建瓶颈」正在洗掉隐形水印
2026-09-02 · Watermarking · Image Editing · Foundation Models · Provenance · Image Forensics
arXiv 2026-09 · 隐形水印鲁棒性评测与生成图像溯源
把带隐形水印的图喂给商用 AI 编辑器,一句「照着重建」就能让水印无法解码,提示词里都不必出现「水印」二字。论文把这称为 watermark laundering,并指出伤害来自重 …
改图改得了内容,改不了机位:CameraEditor 把「换个角度重拍」变成了一段视频
2026-09-02 · Image Editing · Video Diffusion · Camera Control · Computational Photography
arXiv 2026-09 · 用视频扩散模型做相机参数级的图像编辑(ACM MM 2026)
指令编辑模型改内容很在行,改相机角度却一大全视角就结构撕裂。CameraEditor 把目标图改写成一段九帧视频的末帧,用全景裁剪的视觉参考代替含糊文字,靠中间过渡帧把大角度拆成小 …
修 3D 场景不必先懂 3D:FixAnything 把渲染瑕疵当成一段「坏视频」来修
2026-09-02 · 3D Reconstruction · Novel View Synthesis · Video Diffusion · 3DGS
arXiv 2026-08(ECCV 2026)· 用一个视频生成先验统一修复多种 3D 表示的渲染瑕疵
三维重建的渲染在没拍到的地方会糊、会破、会只剩麻点。CMU 团队把要修的渲染序列当成一段视频,用一个现成的视频生成模型加一枚 LoRA 统一修复 3DGS、NeRF、网格和稀疏点 …
不用训练检测器:TRAIL 让冻结的基础模型自己指出照片哪块被 AI 改过
2026-09-02 · Image Forensics · Foundation Model · Edit Localization · DINO
arXiv 2026-08 · AI 修图区域定位(影像取证):零训练,读冻结视觉基础模型的扰动响应找出被改区域
检测照片哪里被 AI 修过,通常要收集标注、专门训练一个定位网络。这篇论文发现:给图像加一层固定扰动,冻结的 DINO 基础模型中各图块特征的「漂移量」本身就是定位图——零训练就在 …
AI 画的图改不了字?DrawAI 把一整张位图解压回图层
2026-09-02 · Image Editing · Multimodal Agent · SVG · Benchmark
arXiv 2026-08 · 图像可编辑化重建:把位图还原成可编辑的 SVG/PPTX 源文件
生成模型交付的永远是压平的位图,改一个字都得重来。DrawAI 把这件事反过来做:两个智能体先读图、写出重建计划,再以「图像即代码」的方式写程序、渲染、比对、回改,把 PNG 还原 …
「鱼眼×热成像」训练里没见过:让看图大模型当老师,教文生图自由组合拍摄方式
2026-09-01 · Text-to-Image · Diffusion · Controllable Generation · VLM
arXiv 2026-08 · 文生图中的成像因子(镜头/传感器/视角/数据域)解耦与可控生成
文生图模型听得懂「画什么」,却控制不好「怎么拍」——而真实数据里镜头、传感器、机位总是捆绑出现。X-MULTI 在训练中主动拼出没见过的成像因子组合,让一个看图大模型逐项判卷,把「 …
评画质别光动嘴:MR-IQA-2 把「说得出毛病」变成「改得动图」
2026-08-31 · IQA · MLLM · Reinforcement Learning · Faithfulness · Image Editing
arXiv 2026-08 · 大模型图像质量评价中的「理由可验证性」;让模型按自己的诊断真去改图,再用裁判复评的涨分检验理由是否忠实
画质模型会打分、也会写一段像样的理由,但理由是不是编的,一直没人查。MR-IQA-2 让模型按自己的诊断真的把图改一遍——改完分数涨了才算看懂,再用掩码归因把「刷分」和「会看」两笔 …
生成只是陪练:GAS 让看图模型「练画」涨眼力,部署时把画笔整个扔掉
2026-08-30 · Multimodal LLM · Visual Understanding · Unified Model · Training Method
arXiv 2026-08 · 统一多模态模型的训练方法:把生成任务改写到特征空间当辅助监督,看图理解提升且推理零开销
看图与画图合体的统一模型里,生成的梯度常把理解带偏。GAS 把生成改写成特征空间里的预测任务、与理解为两条平行支路隔离训练,训练完整体丢弃:理解变准,模型大小与推理速度分毫未变。对 …
一稳就呆,一动就断:Diff-VF 不改一个参数,把短视频模型拉成长片
2026-08-29 · Video Generation · Diffusion · Long Video · Temporal Consistency
arXiv 2026-08 · 长视频生成的时序一致性与动态性
视频生成大模型大多只会拍几秒,滑窗接力的长片会在接缝处跳变、越往后越呆。Diff-VF 不改模型一个参数,只用起始噪声混合、重叠处加权、抽帧重排三招在采样层重建长程关系,在两个底座 …
夜景和变焦拍出来的细节,有一部分是猜的:给相机里的生成过程留一个「撤销」
2026-08-17 · Computational Photography · ISP · Generative AI · Image Provenance · Camera Pipeline
arXiv 2026-04(CVPR 2026 Workshop)· 相机端生成式处理的可逆性与图像真实性
手机的夜景模式和数码变焦已经不只是「增强」,而是在生成从未被传感器测到的像素——放大后看清的那串车牌号,可能是模型编的。这篇论文不去阻止相机生成,而是在按下快门那一刻把「生成加了什 …
要去掉玻璃反光,先学会造反光:S2R 把死结解在了数据这一端
2026-08-16 · Diffusion · Video Restoration · Reflection Removal · Data Synthesis · Computational Photography
arXiv 2026-08 · 视频去反光:用物理约束的合成数据训练扩散模型,一步去噪恢复透射层
隔着玻璃拍视频,反光几乎无解——因为没人能同时拍到「有反光」和「一模一样但没反光」的两段素材。小米 MiLM Plus 这篇论文没有硬做去除模型,而是先把「造反光」做成一个可控的生 …
「压得像」不等于「好生成」:V-RAE 用一次插值,测出了视频隐空间里的坑
2026-08-15 · Video Generation · Tokenizer · Representation Learning · Diffusion · Evaluation
arXiv 2026-08 · 视频生成的隐空间表征与压缩
视频生成模型不直接在像素上工作,而是先把视频压成一小串数字(隐空间),再在这串数字上生成。这篇论文指出:这个压缩器一直按「解压后像不像原视频」训练,但这个标准和「好不好生成」几乎不 …
重建三维场景时,别把「这张照片被压过」当成噪声:JSGS 直接读了 JPEG 自带的量化表
2026-08-14 · 3D Gaussian Splatting · Novel View Synthesis · JPEG · DCT · Image Compression
arXiv 2026-08 · 混合压缩质量下的三维高斯重建监督
一堆压缩程度不同的照片重建三维场景时,糊的那几张会把清楚的那几张一起拖下水。JSGS 的做法不是去猜哪里被压坏了,而是读取每个 JPEG 文件里本来就存着的量化表,把「这张图被压掉 …
改完一处,整张图都变了:EditMod 把建模对象从「图像」换成「这一次改动」
2026-08-13 · Image Editing · Visual Autoregressive · Diffusion · Text-Guided Editing
arXiv 2026-08 · 文本指令图像编辑;把编辑从「重画一张」改成「预测一份改动量」
指令编辑的老毛病是改一处、动全图,根因是主流做法本质上在照着原图重画一遍。EditMod 换了个提问方式:在同一个上下文下把原描述和新指令各问一遍模型,两次预测的差就是这条指令真正 …
画面更清楚了,人却认不出来:CodecArena 让大模型当视频编码的裁判
2026-08-12 · Video Compression · Neural Codec · Quality Assessment · Vision-Language Model · Reinforcement Learning
arXiv 2026-08 · 低码率视频编码的画质评价;把编解码器之间的优劣比较交给视觉语言模型来判
低码率下的新一代视频编码器不再传输细节,而是让解码端把细节「编」出来。这类结果在 LPIPS、DISTS 这些主流感知指标上分数很好,但人脸可能换了个人、字幕可能变成鬼画 …
把「模型懂不懂颜色」变成一局桌游:162 个视觉语言模型,输给了 325 个普通人的共识
2026-08-11 · VLM · Color Naming · Memory Color · Color Science · Benchmark
arXiv 2026-08 · 用色度标定过的桌游测模型与人的颜色共识
这篇论文没有再造一个颜色 benchmark,而是把桌游《Hues and Cues》的 480 格棋盘做了实测色度标定,直接当成一个离散色度空间来用。更关键的是它先用 325 名 …
加速让视频模型变得千篇一律:DUET 把两种蒸馏方式分派给两步去噪
2026-08-11 · Video Generation · Diffusion · Distillation · Efficiency
arXiv 2026-08 · 视频扩散少步蒸馏中的质量-多样性权衡
少步蒸馏让视频扩散模型快了,代价是同一句提示词反复生成几乎一样的画面。DUET 的做法不是把两种蒸馏损失混起来调权重,而是按噪声阶段分工:高噪声那一步交给保多样的专家定构图,低噪声 …
颜色重建被改写成了画线:1930 年的彩色胶片,卡住的其实是几何
2026-08-10 · Color Reconstruction · Demosaicing · SFA · Human-in-the-Loop · Film Archive
arXiv 2026-08 · 透镜光栅胶片的颜色重建与人在环校正
Kodacolor 这类透镜光栅胶片把颜色编码成一排排细条纹,还原时最难的不是调色,而是把每条透镜的边界对准。这篇论文干脆把边界做成可编辑的矢量对象,让专家手动纠正后再回灌微调模 …
夜景照片发紫,不是白平衡估错了:把黑电平误差从噪声模型里拆出来
2026-08-09 · RAW · ISP · Color Bias · Low-Light · Denoising
arXiv 2026-07 · 低光去噪后发紫的根因:黑电平误差
低光去噪后暗部发紫,长期被当成白平衡或去噪网络的锅。这篇把根因定位到黑电平误差——一个归一化后被 100–300 倍放大、且逐通道不同的零点偏置,并证明把它塞进噪声模型里一起学反而 …
31 个波段不如 5 个方向:这篇论文把「光谱要多少维」变成了一条能扫出来的曲线
2026-08-08 · Color Constancy · 多光谱 · 光谱降维 · AWB · ISP
arXiv 2026-05 · 光源估计到底需要几维光谱的系统消融
EPFL 这篇没有提新网络,而是把「光源估计到底需要几维光谱」当成自变量系统扫了一遍。结论有点反直觉:在同样是三维的情况下,一组从光源本身学出来的投影基就把角度误差从 7.78° …
白平衡之后的那一步,还在用两个矩阵插值:C²LUT 把 CCM 换成一张随光源变形的 3D LUT
2026-08-07 · Color Correction · CCM · ISP · 3D LUT · Illuminant
arXiv 2026-07 · 用随光源变形的 3D LUT 取代 CCM 插值
相机把 raw 转成 XYZ 这一步,几十年来一直是「按色温在 D65 和 A 光源两个 3×3 矩阵之间插值」。C²LUT 指出这个设计有两处同时失效:CCT 是一维描述子、装不 …
相机看不见的那段光谱,人眼看得见:Color Pass-Through 把相机和屏幕当成一个系统来标
2026-08-06 · 色彩还原 · 跨设备一致性 · 同色异谱 · 光谱重建 · ISP
arXiv 2026-07 · 把相机与显示当成一个系统端到端标定
手机拍完在屏上看,和眼睛直接看差一大截。这篇不再分别标定相机和屏幕、中间用 CCM/3D LUT 连起来,而是把两者当成一个耦合系统端到端学;更关键的是它显式补上了「相机三通道完全 …
没有真值也能学去马赛克:PEFD 把相机的一次转身,变成了免费的第二次观测
2026-08-05 · 多光谱 · MSFA · Demosaicing · 自监督 · Foundation Model
arXiv 2026-03 · 无需真值的自监督多光谱 MSFA 去马赛克
快照多光谱相机一个像素只测一个波段,16 通道就有 15/16 是猜的,而监督学习要的真值只能靠又慢又笨的线扫描拿。这篇论文不再想办法凑真值,而是把相机绕光心的转动当成监督信号—— …
大模型看的一直是 ISP 的影子:PRISM-VL 把视觉大模型的输入换成 RAW 派生的线性 XYZ
2026-08-04 · VLM · RAW · ISP · Color Science · XYZ
arXiv 2026-05 · 把 VLM 的视觉输入从 sRGB 换成 RAW 派生的线性 XYZ
视觉大模型几乎都在读 ISP 输出的 8-bit sRGB,而这层渲染在模型看到之前就已经把高光截了、把暗部量化了。PRISM-VL 提出把 VLM 的输入换成 RAW …
50 多个视觉编码器的「色差尺子」:与 CIEDE2000 辨别域的重合度不到 0.25,而随机猜是 0.33
2026-08-03 · Vision Encoder · Color Difference · CIEDE2000 · Perceptual Metric · Color Science
arXiv 2026-07 · 视觉编码器的色差尺子与人类辨别阈的对比
这篇论文没问「模型认不认识颜色」,而是问「模型的色差尺子准不准」:把 50 多个预训练视觉编码器的特征距离,拿去和 CIEDE2000 等色差域算几何重合度(IoU), …
把「颜色被墙改掉」当成噪声:DiffPC 用扩散模型解投影仪的逐像素色彩补偿
2026-08-02 · Diffusion · Color Correction · 跨设备色彩一致性 · Projector-Camera · 逆问题
arXiv 2026-06(TVCG)· 扩散模型做投影仪逐像素色彩补偿
投影仪打到有花纹的墙上,颜色就不是你要的颜色了。DiffPC 没有再训一个补偿网络,而是把「被表面和环境改掉的那部分颜色」直接当作一种噪声,于是补偿变成去噪,用扩散先验做逆问题;条 …
那条裙子为什么会翻:这篇论文把颜色的「二义性」变成了一个能测出来的尖峰
2026-08-01 · Intrinsic Decomposition · Color Constancy · AWB · CLIP · Uncertainty
arXiv 2026-07 · 反照率-光照分解中二义性的可测刻画
同一组 RGB 既可以是「蓝黑裙 + 暖光」,也可以是「白金裙 + 冷光」——这不是模型不够强,是问题本身在某些地方无解。这篇论文的转折在于:它把「哪里会翻」写成了一个有解析形式、 …
AI 修图时会顺手改白平衡,所以先把白平衡从评分里剪掉:3DLP 用一千对实拍 HDR 追问生成模型懂不懂光
2026-07-31 · Diffusion · Image Editing · White Balance · HDR · Benchmark
arXiv 2026-06 · 实拍 HDR 光探针评测生成式修图懂不懂光
海德堡大学与慕尼黑工大的团队实拍了 1000 对「灯开 / 灯关」的高动态范围图像,测生成式修图模型是否真懂光的传播。有意思的是:这些模型会像摄影师一样自作主张地调白平衡和曝光,于 …
「风格」不该从语义编码器里读出来:StatLUT 把调色压成三个 Lab 统计量
2026-07-30 · 3D LUT · Color Grading · Diffusion · ISP · Color Science
arXiv 2026-07 · 用三个 Lab 统计量驱动 3D LUT 调色
照片级调色一直靠预训练图像编码器提「风格」,结果把语义也一起提了进来,出现莫名的空间扭曲。StatLUT 干脆不用编码器:只从 CIE Lab 里取三个与空间无关的统计量, …
ΔE 小就够了吗:十一个视觉大模型里,颜色被存成了完全不同的东西
2026-07-29 · VLM · Color Appearance · Color Naming · CIELAB · ISP
arXiv 2026-07 · 视觉大模型内部颜色表征的差异
这篇论文没做白平衡,也没碰 ISP,但它问了一个对 ISP 很致命的问题:当图像的最终消费者是模型而不是人眼,我们习惯用的 CIELAB 几何距离还够不够描述「颜色」。 …
「抗光照」和「看得见颜色」是一对会互相拆台的目标
2026-07-28 · VLA · Color Constancy · 数据增广 · 色彩机制 · AWB
arXiv 2026-07 · 颜色增广与光照鲁棒性之间的相互拆台
这篇论文表面是给机器人大模型做光照攻击与防御,真正有价值的发现藏在中间:为了让模型不怕光照变化而做的常规颜色增广,会把模型训练成「色盲」——它学会的不是抗干扰,而是干脆不看颜色。作 …
「像不像」得先问「哪儿像」:TPIPS 用一句话把颜色从感知距离里拆出来
2026-07-27 · VLM · 感知度量 · 色差 · 图像质量评价 · 生成模型评测
arXiv 2026-07 · 可用一句话指定比较维度的感知相似度度量
LPIPS 的作者之一带队,把感知相似度从一个标量拆成「可用自由文本指定维度」的度量:你可以只问「色调像不像」,而不让纹理和构图掺进来。100 万条人类三元组判断显示, …
换探测器不用重训:ΠGDM 把「光谱先验」和「传感器响应」彻底拆开
2026-07-26 · Diffusion · Spectral Reconstruction · Multispectral · Sensor Design · Uncertainty
arXiv 2026-07 · 把光谱先验与传感器响应拆开的光谱重建
这篇不是又训了一个光谱重建网络,而是把「学到的光谱先验」和「探测器的响应度矩阵」拆成两件独立的东西:先验用公开光谱库训一次,换一套探测器只需要换掉物理前向模型里的那个矩阵,不重训。 …
一台相机一个逆 ISP:SpiralDiff 用一枚 LoRA 让扩散模型学会「按相机还原 RAW」
2026-07-25 · Diffusion · RGB-to-RAW · Inverse ISP · Cross-Camera · White Balance
arXiv 2026-03 · CVPR 2026 · 相机条件下的 RGB→RAW 逆 ISP
把 sRGB 还原成 RAW 从来不是一个逆问题,而是每台相机各一个——因为不同相机的光谱敏感度切出的原始色空间不同。SpiralDiff 把它写成相机条件下的扩散生成, …
别再回归一个光照向量:WaveDiff-CC 把白平衡改写成小波域里的扩散生成
2026-07-24 · Diffusion · Color Constancy · AWB · White Balance · ISP
PRCV 2025 · 在小波域用扩散生成做色彩恒常
WaveDiff-CC 不再把色彩恒常当成’估一个 RGB 光照向量’的回归题,而是用条件扩散模型在小波多尺度域里生成数据驱动的先验,再用动态多头注意力跨尺 …
一张 RGB 到底藏着几条光谱?R2H-Diff 用扩散模型把'说不准'本身建模出来
2026-07-23 · Diffusion · Spectral Reconstruction · Hyperspectral · ISP · Color
arXiv 2026-05 · 扩散模型做 RGB 到高光谱的重建
RGB 反推光谱是个欠定逆问题——同一组 RGB 可能对应无数条光谱曲线。R2H-Diff 不再用回归给一个’平均答案’,而是用条件扩散模型把这条曲线的整个 …
不估光照,先把色卡'画'进画面:GCC 用扩散模型解决跨相机白平衡
2026-07-22 · Diffusion · Color Constancy · AWB · Cross-Camera · ISP
arXiv 2025-02 · 用扩散模型把色卡补画进场景来做白平衡
过去的白平衡是从 RGB 直接回归光源,换台相机就失灵。GCC 反过来:用预训练扩散模型把一张标准色卡’补画’进你拍的场景,再从这张被现场光染过的色卡上读出 …
把「会推理的修图」塞进手机:VeraRetouch 用 0.5B 小模型 + 可微调色渲染器闭环
2026-07-21 · VLM · Photo Retouching · Differentiable ISP · Color Grading · On-device
arXiv 2026-04 · 端上可微渲染器闭环的推理式修图调色
近一年修图 agent 的主流是让 MLLM 去点 Lightroom 的 200 多个按钮,但外部软件不可微,整条链路没法端到端训。VeraRetouch 换了个思路:0.5B …
用一句话拧 ISP 的调色旋钮:Language-based Color ISP Tuning
2026-07-20 · ISP · Color Science · VLM · CLIP · Computational Photography
arXiv 2025-09 · CIC 2025 · 用自然语言调 ISP 的色彩模块
这篇 Sony 的 CIC 2025 短文没有再训一个文本改图模型,而是把 ISP 里的调色块改写成可微的,再让一个 CLIP 式的视觉-语言模型当损失函数,用『happy …
RawGen:把只见过成品图的扩散大模型,反过来'造'RAW
2026-07-19 · Diffusion · RAW · Inverse-ISP · Color Science · AWB
arXiv 2026-04 · 用扩散模型生成 RAW 图像
Michael Brown 组把只在 sRGB 成品图上预训练的扩散大模型反过来用,逼它生成物理上成立的线性 RAW,甚至能凭一句文字为指定相机做 text-to-RAW。这 …
画质评价不再是一个分数:IQA-Spider 让大模型能指着像素说「这里坏了」
2026-07-18 · MLLM · IQA · 画质评价 · Grounding · VLM
arXiv 2026-05 · ICML 2026 · 大模型画质评价,能指出失真在哪
传统图像质量评价把一张照片压成一个分数,工程师拿到 6.2 分却不知道哪坏、为什么坏。IQA-Spider 用一个多模态大模型把画质评价统一成「描述—定位—指认」四件事,还能不额外 …
让大模型先看一眼颜色对不对:VLM-CC 把色彩恒常做成了反馈闭环
2026-07-07 · VLM · Color Constancy · AWB · ISP · Color Restoration
arXiv 2026-05 · 用视觉语言模型做跨相机色彩恒常
VLM-CC 不让大模型直接回归光源颜色,而是先做一次白平衡,再让 VLM 判断画面还偏红、偏绿还是偏蓝,最后把这个语义反馈转成下一轮照明估计。它的价值在于把大模型放到颜色还原的评 …