LightInteraction 不重训加速交互视频世界模型 2.59 倍
新智元 · wechat · 2026-07-22
LightInteraction 用“状态感知”加速交互式视频生成
浙江大学和 NVIDIA 提出 LightInteraction,目标是不改模型参数、也不重新训练,而是在推理阶段把交互状态用起来,让交互式视频世界模型更快、更稳地生成长轨迹视频。
作者指出这类系统的主要瓶颈在于:历史上下文越长,KV cache 显存越大;注意力计算越重;每个片段还要经历多步去噪,整体延迟迅速膨胀。LightInteraction 的做法是把相机轨迹变成调度信号,根据当前状态动态决定算多少:
- 上下文管理:探索新区域时减少不可靠历史,回访旧区域时保留更多空间记忆;
- 去噪缓存复用:只在回访状态下复用更稳定的去噪输出;
- 3D 稀疏注意力:只稀疏历史视觉 KV,同时保留文本条件和当前 chunk 的稠密计算,并通过 Triton 融合算子减少搬运开销。
实验在 HY-WorldPlay 和 Matrix-Game-3.0 上进行。在 HY-WorldPlay 上,约 10 秒视频的主干推理延迟从 228.60 秒降到 88.24 秒,达到 2.59 倍加速,峰值显存从 76.57GB 降至 54.66GB;在 Matrix-Game-3.0 上,约 20 秒视频的延迟从 59.70 秒降到 37.07 秒。
文章强调,这类方法的价值不只是单点提速,而是把交互轨迹、历史可靠性和去噪稳定性变成推理调度信号,为游戏模拟、虚拟场景探索、机器人训练等场景提供更现实的加速路径。
「多模态」频道最新
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11
- 用 Midjourney+Seedance 把龙神宿敌大战拍成 AI 电影短片 — azed_ai · 2026-09-11
- fable 5.1 用 25.6 万条 JS 笔画复刻《星月夜》 — cedric_chee · 2026-09-11
- GPT-6 Astra 接 Hyper3D MCP,一句话生成 3D 资产 — ahuja_priyank · 2026-09-11