FlashForward 复用在途 KV 缓存,长视频扩散生成提速最高 2.9 倍

Yikai Wang · hf · 2026-09-29

少步自回归视频扩散逐块生成长视频,以往方法需要额外前向来重建干净 KV 缓存。FlashForward 直接复用当前 chunk 去噪时已计算出的「在途」缓存,省去只为更新缓存的前向;每个阶段分配一张 GPU,即可让不同 chunk 并行占据不同阶段。

代价是阶段匹配的历史带有噪声,导致外观与运动漂移;为此引入生成前产出的稀疏干净 anchor latents 作双向条件:稀疏干净 anchor 提供粗粒度长程结构引导,稠密阶段匹配历史保留近期细节。

结果:最多 4 张 GPU 下,比 HiAR 快 1.16–1.69 倍、比 Self-Forcing 快 1.42–2.92 倍,覆盖 1.3B/14B、480p/720p、20 秒以上 16FPS 视频;VBench 上 1.3B 模型 480p 得分更高,且在 20s/35s/65s 时长下保持稳定。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →