NVIDIA PDD 用 4–8 步蒸馏加速图像和视频生成
nvidia · hf · 2026-07-29
- NVIDIA 提出 Parallel Decoding Distillation(PDD),一种基于轨迹的蒸馏方法,用来加速图像和视频生成中的 diffusion / flow matching 模型。
- 论文强调它比基于 VSD 和对抗损失的方案更简单、可扩展,后者虽然能出高质量结果,但训练难、容易模式坍塌,视频多样性和运动表现会受损。
- PDD 的核心做法是:一次网络评估预测多个去噪步,支持不同数量的 function evaluations(NFE),并且可接到任意预训练模型上。
- 作者称它在 LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video、Qwen-Image Text-to-Image 上都取得了 4–8 NFE 的 SOTA 表现,同时显著提升了生成视频的多样性。
「多模态」频道最新
- Flux 3 用盗摄金属现场提示词追求粗粝真实感 — fofrAI · 2026-07-29
- 0.5B 参数的实时键盘控制视频模型已能交互运行 — multimodalart · 2026-07-29
- VisoMaster 开源换脸工具支持图像视频与表情微调 — tom_doerr · 2026-07-29
- 用 img 2.0 生成的 Elon 与 Sam 对话梗图 — SkyNo7576 · 2026-07-29
- ComfyUI 0.29 增加流式视频与 GPT 5.6 节点 — pytraveler · 2026-07-29
- 作者称一张专辑从头到尾都由 AI 制作,使用了 Suno — Kyrannio · 2026-07-29