LightInteraction 不重训加速交互视频世界模型 2.59 倍
新智元 · wechat · 2026-07-22
LightInteraction 用“状态感知”加速交互式视频生成
浙江大学和 NVIDIA 提出 LightInteraction,目标是不改模型参数、也不重新训练,而是在推理阶段把交互状态用起来,让交互式视频世界模型更快、更稳地生成长轨迹视频。
作者指出这类系统的主要瓶颈在于:历史上下文越长,KV cache 显存越大;注意力计算越重;每个片段还要经历多步去噪,整体延迟迅速膨胀。LightInteraction 的做法是把相机轨迹变成调度信号,根据当前状态动态决定算多少:
- 上下文管理:探索新区域时减少不可靠历史,回访旧区域时保留更多空间记忆;
- 去噪缓存复用:只在回访状态下复用更稳定的去噪输出;
- 3D 稀疏注意力:只稀疏历史视觉 KV,同时保留文本条件和当前 chunk 的稠密计算,并通过 Triton 融合算子减少搬运开销。
实验在 HY-WorldPlay 和 Matrix-Game-3.0 上进行。在 HY-WorldPlay 上,约 10 秒视频的主干推理延迟从 228.60 秒降到 88.24 秒,达到 2.59 倍加速,峰值显存从 76.57GB 降至 54.66GB;在 Matrix-Game-3.0 上,约 20 秒视频的延迟从 59.70 秒降到 37.07 秒。
文章强调,这类方法的价值不只是单点提速,而是把交互轨迹、历史可靠性和去噪稳定性变成推理调度信号,为游戏模拟、虚拟场景探索、机器人训练等场景提供更现实的加速路径。
「多模态」频道最新
- Midjourney 用单字符参考做出这张图 — gen_ericai · 2026-07-22
- Seedance 2.0 提示词示范环法赛事跟拍镜头 — techhalla · 2026-07-22
- 复古赛璐璐动画提示词模板,一秒做出老动画帧感 — azed_ai · 2026-07-22
- Google DeepMind 把 Street View 全景变成交互旋转视频 — nathanbenaich · 2026-07-22
- Revid 监控 GitHub 仓库后全自动生成演示视频 — tibo_maker · 2026-07-22
- 一个免费 ComfyUI 工作流,主打角色一致性生成 — lumos675 · 2026-07-22