蚂蚁开源具身视频模型 LingBot-Video

蚂蚁集团旗下 Robbyant 正式开源了面向具身智能的视频基础模型 LingBot-Video。该模型不追求传统的视频视觉画质,而是致力于理解真实物理规律,旨在作为机器人的“大脑”基础组件,应用于数据引擎、策略评估和动作规划等场景。

关键细节与架构

LingBot-Video 采用完全定制的 DiT + MoE(混合专家)架构。模型总参数量达到 30B,但在推理时每次仅激活 3B 参数。这种设计使其在处理百万级(1M)长 token 序列时,推理效率显著优于稠密架构,官方称在长输入上比稠密模型快约 3 倍,适合实时机器人规划。此外,该模型支持交互式使用,最长可生成 1 小时的视频,并带有负责驱动整个流程的 agent。模型基于大规模互联网视频预训练,并加入了 7 万小时的具身数据。

训练机制与评测表现

在训练机制上,团队改变了传统视频模型仅追求视觉美观的打分机制,采用单步 GRPO 算法并引入 6 个精确奖励信号:视觉质量、图文对齐、动态程度、运动连贯性、人类动作一致性和物理合理性,以避免模型“伪造”物理效果。在公开的 RBench 测试中,LingBot-Video 平均得分为 0.620,在操作、长周期和四足机器人任务上领先其他开源模型,但团队也坦诚其在空间和机械臂任务上仍不及闭源的 Wan 2.6 模型。

开源情况

该模型的代码和权重已完全免费开源,采用 Apache 2.0 协议。官方同步公开了模型文件、代码库、研究论文及项目主页等相关链接,方便开发者获取与复现。

2026-07-09 ~ 2026-07-10 · 26 条相关

一手来源

另有 5 条近重复转述:_akhaliq · thetripathi58 · dr_cintas · rohanpaul_ai · aigclink