要去掉玻璃反光,先学会造反光:S2R 把死结解在了数据这一端

🧠 大模型影像论文精读 · 2026-08-16 · Diffusion · Video Restoration · Reflection Removal · Data Synthesis · Computational Photography
arXiv 2026-08 · 视频去反光:用物理约束的合成数据训练扩散模型,一步去噪恢复透射层
图片来源:Wang et al., arXiv:2608.11562

隔着玻璃拍东西,是最常见也最没办法的一类翻车:橱窗里的鞋、水族馆里的鱼、博物馆展柜里的青铜器、车窗外的街景——你想拍的那一层(论文里叫透射层,就是玻璃后面你真正想要的画面)总是被玻璃反射的另一层盖住,而且反光会随着你走动而滑动。单张照片去反光已经研究了很多年,但视频去反光几乎是空白。

https://codingwzp.github.io/VideoDereflection_S2R/static/images/fig1_overview.jpg

卡住这件事的不是模型,是数据

要训一个去反光的模型,你得有成对样本:同一段画面,一份带反光、一份不带,而且逐帧严丝合缝对齐。现实里拍不出来——你把玻璃撤掉再拍一遍,光照变了、手抖了、路上的人走了。

于是过去大家用一条捷径:拿两段干净视频,按比例叠加,一段当"透射",一段当"反光"。问题是真实玻璃不是这么工作的。玻璃粗糙一点,反光就是糊的;玻璃厚一点,前后两个表面各反一次,会出现错开的重影;镀膜和入射角决定反光有多强。简单叠加把这些全抹平了,模型学到的是一种在现实中不存在的反光。

转折:把"去除"倒过来,先做一个能捏的"造反光"

这篇论文的做法是把合成从像素层面抬到结构层面。它不在 RGB 上叠图,而是在线稿(lineart,图像抽出的轮廓线,只保留结构、丢掉颜色和明暗)上做文章:

先训一个"反光渲染器"。素材来自 FLUX——一个文生图模型——逐帧给干净视频"加上反光",生成一批伪样本。这批伪样本逐帧独立生成、会闪,所以它们不当最终数据用,只当老师:渲染器(基于视频扩散模型 Wan2.1)从中学的是"反光在画面上应该长什么样"这件事本身。

有了渲染器,造数据就成了拼装:拿两段干净视频,把其中一段的线稿当作反光的几何,对它施加一组带物理含义的变换——模糊对应玻璃粗糙度、错位重影对应玻璃厚度、强弱对应反射率,还有只覆盖画面一部分、以及不随镜头移动的静止反光——再把它和目标画面的线稿融在一起,交给渲染器渲成一段真实感的带反光视频。因为透射层始终是那段原始干净视频,配对天然就是精确的

去除端则简单得多:在一个预训练的视频扩散模型上做两阶段适配,让它一步去噪就吐出干净的透射层。这里"一步"是关键——扩散模型通常要反复迭代几十次,慢得没法用。

数字里值得注意的两个

一是速度:832×480 分辨率下每帧 87 毫秒,而同期的扩散类方法要 7215 毫秒——差了近百倍,甚至比不用扩散的方法(145 毫秒)还快。这不是调优调出来的,是"一步去噪"这个设计带来的。它意味着这条路线离真机后处理不算远。

二是人工评测里的一个分项:在 50 段实拍视频上,参与者既打"反光去掉了多少",也打"原画面保住了多少"。S2R 的保留分是 0.98,而生成能力很强的对比方法只有 0.83–0.87。这正是生成式修复的老毛病——它一边擦反光,一边顺手把玻璃后面的字、纹理、人脸改成了自己编的版本。分开打这两个分,比只报一个 PSNR 诚实得多。

可能落到哪里

最直接的是手机——这篇出自小米 MiLM Plus,去反光作为拍摄后处理或录像实时预览的一环,是个成立的产品位置。往外扩,行车记录仪隔着挡风玻璃录像、博物馆与展会的手机记录、电商隔柜台拍商品、以及把去反光当作检测/识别的前处理(论文附录也测了下游收益),都是同一个能力。更值得留意的是数据这一半:把"合成退化"从写公式改成"训一个渲染器 + 一组物理化的可控参数",这套思路对去雨、去雾、去屏幕摩尔纹这些同样缺成对数据的任务是通用的。

存疑的地方

第一,评测有自证成分。60 段配对测试视频是他们自己的管线生成的,全参考指标(PSNR/SSIM)天然偏向自家合成的反光分布;真正有分量的是那 50 段实拍的人评,而人评样本量不大。

第二,合成并没有取代传统方法。论文自己的消融显示:只用传统叠加合成提升 +3.93 dB,只用他们的合成 +4.30 dB,两者一起用才是 +5.21 dB。这是互补关系,不是"旧方法作废"。

第三,作者列出的两个失败面很实在:多层玻璃套着的嵌套反光,模型要么留一层残影、要么把本该保留的那层也擦了——因为"这层反光算不算画面的一部分"本身就没有唯一答案;另外合成时反光是按整段片段设定参数的,没有建模镜头移动时反光相对背景的视差变化,而这恰恰是视频区别于单图最典型的线索。换句话说,它造出的反光在时间上是连贯的,但还不够"会动"。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读