画面更清楚了,人却认不出来:CodecArena 让大模型当视频编码的裁判

🧠 大模型影像论文精读 · 2026-08-12 · Video Compression · Neural Codec · Quality Assessment · Vision-Language Model · Reinforcement Learning
arXiv 2026-08 · 低码率视频编码的画质评价;把编解码器之间的优劣比较交给视觉语言模型来判

这篇论文有意思的地方,不是又提了一个更准的画质指标,而是指出:视频编码沿用多年的评价逻辑,在生成式编码时代开始反向起作用——分数更好的那个,可能恰恰是人一眼不能接受的那个

现在卡在哪

视频压缩要在有限码率下把画面尽量还原。传统编码器(H.264、HEVC 这条线)码率一低就出块、发糊。这两年出现了新路子:生成式编码——码率压到极低时干脆不传细节,让解码端凭生成模型的先验把细节"补"出来。画面依旧锐利,纹理和颗粒都在,只是那些细节不是原片里的,是编出来的。

问题出在打分上。论文里最常用的两个感知指标是 LPIPS 和 DISTS:把两段画面分别丢进一个视觉网络,比较中间特征的距离,比 PSNR 更贴近人眼判断,代价是它们衡量的是整帧的纹理相似度,而不是内容有没有被换掉。论文首图就是活证据:同样约 0.15 bpp,两个指标都判生成式编码器赢,可它输出的人脸已经不是同一个人,字幕成了鬼画符。而且不少生成式编码器训练时用的就是 LPIPS 这类感知损失,再拿同一个指标去评它,等于让考生自己出卷子;这些指标又都是逐帧计算的,闪烁和身份漂移根本看不见。

关键转折

作者的判断是:到这一步,“还原得好不好"已不是信号距离问题,而是内容问题——要认出这张脸还是不是同一个人、读出字幕有没有变。这恰好是视觉语言模型(能同时看画面、读写文字的大模型)的活儿,也正是人评片子的方式。所以 CodecArena 不给单个视频打一个分,而是以原片为条件、把多个重建放在一起比,并拆成五项分别打分:人物身份、物体、文字、纹理、时序一致性。

难点在标注。人能可靠地说"A 比 B 更忠实”,但要为每一项都打出校准过的分数,既贵又容易打不准。作者的解法叫 Facet-GRPO:整体胜负用成对偏好监督;分项不给目标值,只用一批自动算出的客观信号(人脸身份相似度、文字可读性、时序一致性等)提供方向——某一项上如果这些信号能明确分出高下,就奖励模型的分项打分与之一致。这是防作弊用的:五项取平均定胜负,模型完全可以靠猛吹"纹理"赢下比较,把脸和字幕的崩坏藏起来。

数据也是自建的:源视频用传统、神经、生成式三类编码器重编、凑成对比组自动打标,得到 1500 组训练集;另请 15 位标注者人工排序,做出 80 段源内容完全不重叠的评测基准。成对选优上,8B 规模的 CodecArena 拿到 93–95% 准确率,工业界最认可的 VMAF 是 85.8–90.0%,LPIPS 只有 79–83%;更值得注意的是,在 7 帧及以上的片段上,LPIPS 和 DISTS 的排序相关性甚至不如老实的 PSNR

可能进入哪些真实流程

最直接的是编码器选型与竞赛评测:今天比较两个编解码器靠率失真曲线加一两个感知指标,一旦生成式解码普及,这套报表会系统性高估"会编"的那一方。产品侧同理,直播和云游戏动态调码率时需要知道降到哪一档会开始"改内容"而不只是"变糊",分项分数天然给出这条红线,而文字和人脸通常最先破。这五个分项也可以反过来进编码器的训练目标,替掉那个正被自己钻空子的感知损失。

需要打问号的地方

训练标签由大模型集成加客观信号自动生成,人工只覆盖 80 段评测视频——裁判的上限因此取决于出题那套自动信号有多准。覆盖面也偏窄:生成式这一族只进了 GLC-Video 一个(当时唯一有公开实现的),而时序判断只看 7 到 14 帧的抽帧条带,真实的闪烁和漂移往往发生在更长的尺度上。

更结构性的疑问是:用大模型当裁判,它自己也会成为新的优化目标。今天它能识破为 LPIPS 优化过的编码器,等有人开始为它优化,这套评价还剩多少免疫力,要下一轮才能回答。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读