PDD 通过一次预测多步去噪加速图像和视频生成
ArashVahdat · x · 2026-07-29
PDD 用多步并行解码加速图像和视频生成
这篇新论文提出 Parallel Decoding Distillation(PDD),用一种更简单的轨迹蒸馏方法,加速扩散模型和 flow matching 模型的图像/视频生成。
- 核心思路不是把相邻 ODE 步合成一步,而是让模型在一次网络计算里预测多个去噪步。
- 该方法号称可兼容任意预训练模型,并支持可变 NFE 采样。
- 作者认为它比 VSD 和对抗损失更容易训练,能缓解这些方法常见的优化困难、模式坍塌和多样性下降。
- 在 LTX-2.3 文生视频/音频、Wan 14B 文生视频、Qwen-Image 文生图 上,论文报告了 4–8 NFE 下的 SOTA 表现。
- 同时,生成视频的多样性也有明显提升。
所属事件:英伟达提出 PDD 方法加速图像与视频生成(3 条相关)→
「多模态」频道最新
- Google DeepMind 发布音乐模型 Lyria 3.5,人声表现与编曲显著提升 — jasonbaldridge · 2026-07-30
- 四个月 Gabor 图像生成实验,变成 Claude 辅助研究项目 — pixlpa · 2026-07-30
- MiniMax H3 视频模型实测:一镜到底极速穿梭悬崖之城 — umesh_ai · 2026-07-30
- 双 RTX 3090 仍难同时装下 Qwen 图像编辑和 27B 文本模型 — Civil_Fee_7862 · 2026-07-30
- 字节 SeedVR2 蒸馏到 14 亿参数,本地超分只要 4.6GB 内存 — TimeTruth2490 · 2026-07-30
- 开源项目 Open-Generative-AI 集成 500 多个图像视频模型 — matchaman11 · 2026-07-30