NVIDIA 纯回归蒸馏:视频生成压到 4 步,追平 DMD2 且不丢多样性

Parallel Decoding Distillation for Fast Image and Video Generation

Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

cs.CV, cs.LG

2026-07-29

PDD 给扩散/流模型加一个一次预测多步的并行解码头,纯回归训练,在 Wan、Qwen-Image、LTX 上以 4-8 步达 SOTA,视频多样性远超 DMD2。

这篇在解决什么

视频和图像的扩散、流匹配模型,生成时要把去噪过程迭代几十到几百次,每次都跑一遍神经网络(网络评估次数,Network Function Evaluations,简称 NFE)。把模型蒸馏成「几步就能出图」的生成器,是目前主流的加速路线。

瓶颈在蒸馏用的损失函数。最强的几种方法(代表是 DMD2)靠变分分数蒸馏(VSD)加对抗损失训练。这类损失难调、显存吃紧,最典型的毛病是模式坍塌(mode collapse):生成器为求稳收敛到少数几个安全样本,视频看起来清楚但彼此雷同、动作僵、缺乏运动。基于轨迹的蒸馏在图像上能打,放到视频上质量又顶不住。

PDD 想同时把「快、简单、保住多样性」这三件事都拿到。

方法

PDD 的做法可以概括成「一次评估算多步」。原始模型每次前向只预测当前这一步的平均速度(velocity),PDD 在它的末端线性层上动手脚:把这一层复制 N 份,每份对应一段去噪区间,于是一次前向就能吐出连续 L 步各自的速度。采样时按块推进,当前状态加上这一块里每步速度乘以时间步长的累加,一次走完 L 步。

训练用纯回归损失,让学生的并行预测去拟合教师模型在每一步的平均速度。教师的速度由 Euler 或 Midpoint 这类 ODE 求解器估出,不依赖 Jacobian-vector product 这类昂贵的二阶量。这正是它简单且稳定的根:没有对抗项、没有 VSD,只是回归。

几个设计选择各有用意。可变块大小(Lmin 到 Lmax)让同一套权重支持不同 NFE,不必额外塞时间条件;推理时那 N 个复制出来的线性层能融合成一个加权平均层,开销更省;训练是数据无关的,在求解与训练之间在线交替,不需要数据集。架构和流程兼容任意预训练模型,这是它能直接套到 Wan、Qwen-Image、LTX 上的前提。

结果

图像(ImageNet-256,教师 SiT-XL+REPA,1 步出图):PDD-Midpoint 的 FID 是 2.69,与 Pi-Flow(2.85)相当,但落后于 FreeFlow(1.45)。1 步设置上它不是最强。

文本生图(Qwen-Image)和质量-多样性的对比更说明问题:

方法NFEOneIG-EN↑DPG↑GenEval↑OneIG 多样性↑
DMD240.52488.250.850.095
Pi-Flow40.53388.110.850.182
PDD-Midpoint40.53888.660.860.174

质量上 PDD 与 DMD2 几乎打平甚至略胜,多样性却是 DMD2 的将近两倍(0.174 对 0.095),这正是它针对的痛点。

文生视频(Wan2.1,VBench,4 步):

模型方法VBench 总分↑V-JEPA2 多样性↑
Wan 1.3BAnyFlow84.450.0704
Wan 1.3BDMD284.690.0833
Wan 1.3BPDD-Midpoint84.940.1032
Wan 14BAnyFlow84.950.0786
Wan 14BPDD-short84.920.0791

1.3B 上 PDD 质量和多样性双第一。14B 上总分(84.92)略输 AnyFlow(84.95),但多样性仍更高,差距在 0.03 个百分点的量级。LTX-2.3 上,教师的 4×30 步,PDD 用 8 步就追平官方蒸馏模型,并且同时覆盖音频轨。

为什么重要

对做生成的团队,这条路线最实在的卖点是简单。纯回归训练,没有对抗损失那套调参地狱,也没有 VSD 的不稳定性,复现和迭代成本低。同一个并行解码头还能挂到任意预训练模型上,Wan、Qwen-Image、LTX 都已验证过。更关键的是它保住了多样性,这是 DMD2 类方法的硬伤,PDD 在质量不掉的前提下把它修掉了大半。

需要泼的冷水:14B 这种大模型上,PDD 的总分并没有稳赢 AnyFlow(84.92 对 84.95),优势集中在多样性而非绝对质量。追求极致单图质量、不在乎样本多样性的场景,它未必是最优解;1 步图像生成上它也还不是 FreeFlow 的对手。

局限与存疑

作者自己列了几条。大规模文生图、文生视频依赖数据无关训练,依赖数据的设置只在小规模 ImageNet 上试过,泛化到数据驱动的视频蒸馏还没验证。ImageNet 上 8 步设置的 FID 反而比 4 步差(可用更低的 guidance scale 缓解)。架构必须和教师严格对齐,换主干要重训。可变 NFE 只能在预设的块大小档位里选,不能任意插值。

额外存疑的一点:NFE 越少,越依赖教师的平均速度估得准,Euler/Midpoint 在极少步数下的估计误差这篇没有单独量化,质量天花板可能被求解器精度卡住。

术语

原文与代码

社区讨论

相关论文

全部论文解读