LightInteraction 不重训加速交互视频世界模型 2.59 倍
新智元 · wechat · 2026-07-22
LightInteraction 用“状态感知”加速交互式视频生成
浙江大学和 NVIDIA 提出 LightInteraction,目标是不改模型参数、也不重新训练,而是在推理阶段把交互状态用起来,让交互式视频世界模型更快、更稳地生成长轨迹视频。
作者指出这类系统的主要瓶颈在于:历史上下文越长,KV cache 显存越大;注意力计算越重;每个片段还要经历多步去噪,整体延迟迅速膨胀。LightInteraction 的做法是把相机轨迹变成调度信号,根据当前状态动态决定算多少:
- 上下文管理:探索新区域时减少不可靠历史,回访旧区域时保留更多空间记忆;
- 去噪缓存复用:只在回访状态下复用更稳定的去噪输出;
- 3D 稀疏注意力:只稀疏历史视觉 KV,同时保留文本条件和当前 chunk 的稠密计算,并通过 Triton 融合算子减少搬运开销。
实验在 HY-WorldPlay 和 Matrix-Game-3.0 上进行。在 HY-WorldPlay 上,约 10 秒视频的主干推理延迟从 228.60 秒降到 88.24 秒,达到 2.59 倍加速,峰值显存从 76.57GB 降至 54.66GB;在 Matrix-Game-3.0 上,约 20 秒视频的延迟从 59.70 秒降到 37.07 秒。
文章强调,这类方法的价值不只是单点提速,而是把交互轨迹、历史可靠性和去噪稳定性变成推理调度信号,为游戏模拟、虚拟场景探索、机器人训练等场景提供更现实的加速路径。
「多模态」频道最新
- Midjourney V8.2 加入个性化并展示新图像效果 — Mr_AllenT · 2026-07-27
- Midjourney 图像多样性引发 Krea 2 对比与复现提问 — diffusion_throwaway · 2026-07-27
- AI 短片把 1985 年反乌托邦拍成电影感作品 — ProfessorKey98 · 2026-07-27
- Google Omni 做出的 BOTPD 新集变成追车戏仿 — ScriptLurker · 2026-07-27
- 一个新 LoRA 复刻了 GTA: San Andreas 的 RenderWare 画风 — Humble-Pick7172 · 2026-07-27
- AMD R9700 开启动态 VRAM 后,LTX 2.3 生成速度大幅提升 — xdcfret1 · 2026-07-27