夜景和变焦拍出来的细节,有一部分是猜的:给相机里的生成过程留一个「撤销」

🧠 大模型影像论文精读 · 2026-08-17 · Computational Photography · ISP · Generative AI · Image Provenance · Camera Pipeline
arXiv 2026-04(CVPR 2026 Workshop)· 相机端生成式处理的可逆性与图像真实性
图片来源:Masud et al., arXiv:2604.21879

这篇有意思的地方不在画质,而在于它承认了一件行业里心照不宣的事:手机拍出来的照片,已经不完全是「拍」出来的——然后给这件事配了一个撤销键。

一、相机自己开始编内容了

「网上的图可能是 AI 做的,但我相机拍的总是真的」——这条直觉正在失效:厂商早已把生成式模块搬进了相机的成像流水线(ISP,负责把传感器读出的原始数据变成你看到的那张 JPEG)。最典型的是数码变焦夜景模式——传感器要么没记录那么多细节,要么几乎没收到光子,模型就按见过的海量照片「补」出一套合理的纹理。

多数时候补得又好看又接近真相。问题出在少数关键处:远处的车牌、路牌小字、一个二维码。模型不是在恢复这些字符,而是在猜一串看起来像车牌的字符——照片的构图、光影、噪声都无懈可击,中间那几个数字却是错的,且毫无常见的「AI 味」,因为它就是从你相机里直接出来的。更麻烦的是这一步不可逆:ISP 中间尚未被生成过的版本,出厂即丢弃。

二、不拦生成,而是把生成变成可撤销的一层

让相机同时存一份未生成的原图,体积翻倍,厂商不会答应;事后用别的模型去还原,等于用一次猜测纠正另一次猜测。这篇选了第三条路:只存差异,而且不存像素、存一个能算出差异的小函数

做法借用了隐式神经表示——用一个很小的网络把某一张特定图像「背下来」,输入位置、输出该处的值。拍摄那一刻相机手上同时有生成前后两个版本,于是当场花几秒训练这样一个小网络,让它学会:给定像素位置和一点图像上下文,输出「这里被生成多加了多少」。看图时把网络跑一遍,减掉残差,就退回了生成之前的版本。让网络去拟合残差比拟合整张图划算得多——残差稀疏,好背。

关键数字只有一个:整套东西约 180 KB,直接写进 JPEG / HEIC 的元数据字段(再存一遍原图是几 MB 起步)。这意味着不需要新文件格式、不需要云端副本、不改变分享习惯——照片还是那张照片,只是多背了一小段「我做过什么」的账。

三、可能进入哪些真实工作流

最直接的是影像取证:执法、保险定损这类把照片当证据的场景,需要的是相机保留一条「可回退到测量值」的通道,而不是建议用户关掉夜景模式。其次是内容凭证体系——C2PA 这类标准主要记录「谁在什么时候改过这张图」,对相机内部的生成环节使不上劲;把可逆残差挂进凭证链,等于让「原始性」从一句声明变成一个可验证的操作。

四、存疑的地方

最根本的一条:退回来的那张也不是原图,而是一次重建。论文报告的复原保真度在 33 dB 量级,视觉上很接近但并非逐比特相同。拿它支撑「这才是相机真正测到的东西」这种取证论断,地基有点软——一个被质疑的字符究竟是模型编的还是残差没拟合准,文章没给判据。

其次是部署门槛:训练这个小网络要拿到 ISP 内部生成之前的中间图像,只有相机厂商做得到,第三方 App 无解——它取决于厂商愿不愿意主动交出「我在这里生成过」的证据,而这与画质卖点天然冲突。安全性作者也明确写了不在讨论范围内:能被随手剥掉或伪造的元数据是便利而非保证。

但这篇的价值在提问方式上:当生成已经进入快门内部,「原图」就不再是不言自明的东西,而需要被显式定义和保存。这个问题所有影像厂商迟早都得回答。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读