LingBot-World 2.0发布交互式视频世界模型
rohanpaul_ai · x · 2026-07-11
这条长帖介绍了新发布的 LingBot-World 2.0 / LingBot-World-Infinity,一个开放源代码的交互式视频世界模型。
主要能力
- 仅需 1 张起始帧,再结合用户的实时摄像头移动或文本指令,就能持续生成场景。
- 作者称其在一次 60 分钟 rollout 中跨越 20 个场景,且从头到尾没有明显质量衰减。
- 支持 720p、60fps 实时输出,并提供在线 demo、多人控制、开放权重。
- 还给出 14B 主模型 和可在单张消费级 GPU 上运行的 1.3B 版本。
方法与训练
- 先用较慢的 causal diffusion model 学习高质量世界预测。
- 再通过 consistency distillation 压缩成少步学生模型。
- 之后用 Distribution Matching Distillation 让学生在自己的长滚动轨迹上继续学习,以适应真实使用时会遇到的“非完美状态”。
系统设计
- 文中把 VLM 视为“Brain”,视频生成器视为“Cerebellum”。
- 还引入 pilot 和 director 两个 agent,一个负责角色行为,一个负责持续补充事件,避免场景跑空。
局限
- 仍然缺乏真正的长期记忆;
- 有时会“重建一个相似地点”,而不是精确回到先前的同一地点。
所属事件:蚂蚁开源LingBot-World 2.0交互式世界模型(15 条相关)→
「多模态」频道最新
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11