LightInteraction 不重训加速交互视频世界模型 2.59 倍

新智元 · wechat · 2026-07-22

LightInteraction 用“状态感知”加速交互式视频生成

浙江大学和 NVIDIA 提出 LightInteraction,目标是不改模型参数、也不重新训练,而是在推理阶段把交互状态用起来,让交互式视频世界模型更快、更稳地生成长轨迹视频。

作者指出这类系统的主要瓶颈在于:历史上下文越长,KV cache 显存越大;注意力计算越重;每个片段还要经历多步去噪,整体延迟迅速膨胀。LightInteraction 的做法是把相机轨迹变成调度信号,根据当前状态动态决定算多少:

实验在 HY-WorldPlay 和 Matrix-Game-3.0 上进行。在 HY-WorldPlay 上,约 10 秒视频的主干推理延迟从 228.60 秒降到 88.24 秒,达到 2.59 倍加速,峰值显存从 76.57GB 降至 54.66GB;在 Matrix-Game-3.0 上,约 20 秒视频的延迟从 59.70 秒降到 37.07 秒。

文章强调,这类方法的价值不只是单点提速,而是把交互轨迹、历史可靠性和去噪稳定性变成推理调度信号,为游戏模拟、虚拟场景探索、机器人训练等场景提供更现实的加速路径。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →