加速让视频模型变得千篇一律:DUET 把两种蒸馏方式分派给两步去噪

🧠 大模型影像论文精读 · 2026-08-11 · Video Generation · Diffusion · Distillation · Efficiency
arXiv 2026-08 · 视频扩散少步蒸馏中的质量-多样性权衡
图片来源:Li et al., arXiv:2608.09637

这篇论文有意思的地方,不是又把视频生成压快了一点,而是它把「画质」和「多样性」这对长期被当成跷跷板两端的东西,改成了两个不同的岗位。

先说卡在哪。视频扩散模型采样很贵:一段几秒的片子,网络要反复跑几十遍,每遍都要处理几十帧画面。真要上线(广告素材、电商短视频、手机一键成片),几十步不能接受,于是业界普遍做「蒸馏」:训一个学生模型,一两步走完老师几十步的路。

蒸馏有两条主流路线,用大白话讲就是学法不同。一条学老师怎么走(代表方法 sCM):每一小步都尽量对上老师的方向。这种求稳取平均的学法把变化留住了——同一句提示词多跑几次,构图、镜头、风格确实不一样——但画面容易发虚发糊。另一条学老师走出来的结果(代表方法 DMD):不管路径,只要求学生的输出落进老师的成品分布里。它锐利干净,但会一路往「最像的那一种」靠,于是同一句提示词生成十次,得到十个几乎一样的画面。

https://arxiv.org/html/2608.09637v1/x1.png

作者把它量了出来:同一提示词下多次生成,两种学生在特征空间的展开度差约 2.35 倍。对做内容的人,多样性塌缩比画质差半档更致命。以往的应对是把两种损失混在一起调权重,让同一套参数和两个偏好相反的目标谈判;论文的判断很直接:这种谈判能改善,但去不掉。

DUET 的转折是不在损失里调和,而是按噪声阶段分工:两步采样里,第一步从纯噪声出发,定的是构图、主体位置和运动;第二步在已成形的画面上收细节和质感。那就让「保多样」的专家做第一步,「出锐利」的做第二步,两位各用原本的目标独立训练,谁也不必妥协。

真正的麻烦在交接。第二步的专家训练时接的是自己走出来的中间画面,实战里接的却是另一位专家的输出,两者对不上。补法(论文称 DUET+)是把第一步专家的真实输出拿去重训第二步专家,同时用人类偏好打分做奖励,对第一步专家再做一轮强化学习微调。

结果照实读。在 Wan2.1-T2V-1.3B 上、严格两步:DMD 画质 84.38 而多样性只有 0.0727,sCM 多样性 0.1865 而画质 81.51。DUET 拿到多样性 0.1512、画质 83.96——多样性翻倍,画质仍略低于 DMD。真正站住的是 DUET+:画质 84.40 追平 DMD,多样性保持两倍。它在两个轴上都不输 DMD;但离 sCM 的展开度还差约两成,摘要里「几乎全部保留」偏乐观。

往下游看,这个分工思路能落到几处真实工作流:广告与电商素材批产,一句脚本要二十版备选,两步出片且不塌缩才有得挑;端侧一键成片和实时预览,只有两步的算力预算够塞进手机,而既然两位专家职责不同,第一步那位未必要同等规格;交互式世界模型和游戏内生成里,多样性就是「玩第二遍不一样」的前提。另外,少步蒸馏的榜单几乎只看画质,多样性塌缩不进榜,模型就会一直朝千篇一律优化。

存疑处有四条。一是两位专家都要驻留内存,参数量翻倍——算力和延迟与普通两步学生一致,但显存翻倍,恰好是端侧最紧的那项。二是只在 1.3B 骨干上验证,作者承认没上 14B。三是只测了严格两步,四步、八步时这套阶段分工还成不成立,论文没答。四是多样性指标只是代理(特征空间的平均成对距离),画面变糊、结构不稳也会把它抬高,所以 0.15 与 0.19 那点差距别读得太死;但 DMD 那个 0.07 的塌缩,在图上肉眼可见。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读