LingBot-World-Infinity:14B 世界模型实现 60fps 实时 720p 生成,连续运行超一小时无画质衰退

Infinite Worlds with Versatile Interactions

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

cs.CV

2026-07-08

LingBot-World-Infinity 提出因果预训练加少步蒸馏的双阶段方案,将 14B 交互世界模型压缩为可在单卡实时运行的 1.3B 学生模型,720p/60fps 下持续生成超过一小时无可见画质衰退,并引入「导演-飞行员」双智能体框架支持多样化语义交互。

这篇在解决什么

交互式世界模型面临两个根本性矛盾:长时稳定性与实时交互能力。现有系统在自回归生成过程中,每一帧的误差都会被反馈回模型,导致纹理模糊、几何变形,多数系统在数秒到数分钟后就会出现明显质量下滑。另一边,高保真视频生成的计算代价极高,在维持细节的同时响应实时输入几乎不可能兼顾,此前方案普遍以牺牲分辨率或流畅度换取可交互性。

即便有了稳定的生成模型,「谁来操控角色行为」仍是悬而未决的问题。单纯的视频生成器没有目标感,无法自主规划角色动作或为探索中的场景持续补充内容。这三层挑战共同构成了本文的研究目标。

方法

因果预训练阶段:LingBot-World-Infinity 将世界模拟建模为沿时间轴的因果生成过程,每帧状态仅依赖历史观测和当前用户输入。核心创新是「双向与自回归混合注意力掩码」(MoBA):在标准的 Teacher Forcing 掩码基础上附加一个完全双向块。纯 Teacher Forcing 会导致模型随上下文增长过度依赖历史,出现过拟合和质量退化;双向块充当正则项抑制这一现象。交叉注意力侧采用对应的因果掩码,防止未来语义泄露。

后训练蒸馏阶段:将多步预训练扩散模型压缩为少步实时生成器,同时抑制长时自回归展开中的误差积累。具体结合两种蒸馏手段:一致性蒸馏(Consistency Distillation)通过强制同一教师 PF-ODE 轨迹上相邻点映射到相同预测,将多步去噪压缩为少步;分布匹配蒸馏(DMD)进一步用学生和真实数据的 KL 散度梯度修复保真度。DMD 在学生自身的长时展开轨迹上训练,使学生在自己生成的状态分布上被优化,从而减少累积漂移。

部署层:系统推理栈由四部分组成:编译器优化与多 GPU 并行;延迟解码和帧重建异步流水线化;动态 KV 缓存调度根据当前控制信号适应性保留最相关历史;时空精炼器作为轻量后处理模块先做空间上采样,再合成中间帧提升帧率。

导演-飞行员智能体框架:视觉语言模型(VLM)作为「导演」负责宏观语义规则和因果推理,Diffusion Transformer 作为「飞行员」负责低级物理动力学渲染。两种交互模式并行支持:直接语义交互(VLM 分析当前帧生成动态事件卡)和追踪辅助对象交互(集成 SAM 模型持续追踪可交互对象,用户选定后触发精确操作)。

结果

在与 HappyOyster、Genie 3 等闭源系统及 Matrix Game 3.0、DreamWorld 等开源模型的对比中,LingBot-World-Infinity 是对比组中唯一能以小时级(而非分钟级)持续生成且不出现明显衰退的系统,也是唯一同时具备实时性、高动态度、丰富语义交互且完全开源的模型。

长时稳定性压测中,模型在单次超过 60 分钟的不间断会话中视觉质量无可感知衰退,跨越 20 个不同场景保持连贯场景结构,证明稳定性来自结构性设计。因果预训练骨干与 MAGI-1、Worldplay 等先前因果模型相比,在匹配设置下持续输出更锐利的纹理和更稳定的几何,在先前系统数分钟内即退化的时间跨度上表现出显著优势。

为什么重要

这项工作将交互式世界模型的可用时间跨度从分钟量级推进到小时量级,从技术上证明了「像素级自回归生成」与「实时交互」并非鱼和熊掌不可兼得。14B 教师加 1.3B 学生的配对设计使单卡部署成为可能,极大降低了社区使用门槛。

双智能体框架的引入意味着一个转折:世界模型不再只是「给定输入、渲染下一帧」的无状态函数,而开始向具备目标感、能够自主规划并动态补充内容的完整世界引擎演进。这对游戏生成、具身智能仿真以及视频交互界面的研究都有直接的参考价值,同时完整开源也使后续研究得以直接在此基础上推进。

局限与存疑

长期记忆缺失是最根本的局限:模型在视觉上保持稳定,却并不真正「记住」已生成的世界。离开上下文窗口后再次经过同一区域,通常会重新生成一个相似但不相同的场景,世界在外观上持久,但在身份上并不连续。动态 KV 缓存调度是缓解方向之一,但内存成本随时域增长和固定预算之间的张力是内在矛盾,尚无完整解法。

角色与风格一致性在极长时序下仍会发生细微漂移。物理理解层面,模型从像素学习动态,偶尔出现角色或物体穿模等物理不合理现象。算力门槛方面,实时运行仍需可观的计算资源,在消费级硬件上实现高保真世界建模还需要进一步的效率提升。

术语

原文与代码

社区讨论

相关论文

全部论文解读