LingBot-VA/VLA 2.0发布:原生具身基础模型与跨机身控制

蚂蚁系具身智能公司(@robbyantbrain)发布了LingBot-VA 2.0与LingBot-VLA 2.0模型。这套模型摒弃了在现成视频生成模型上外挂动作头的常规做法,选择从零开始进行原生视频-动作联合预训练,旨在解决通用机器人控制与跨机身泛化问题,因其在架构与跑分上的突破而备受关注。

核心设计与技术细节

作者@omarsar0 与 @heyshrutimishra 指出,纯粹的视频生成模型只能学到外观,无法理解动作如何改变物理世界。为此,LingBot模型将世界状态与潜在动作置于同一语义潜空间,通过无标注网络视频进行自监督学习。架构上,模型采用30B MoE设计(生成时仅激活3B参数),并包含完整因果Transformer。为实现实时控制,工程上采用了双专家蒸馏、FP8 TensorRT和paged KV-cache等优化,将单块延迟从927ms降至142ms。此外,@omarsar0 还强调了其“闭环推理”机制,能在执行当前动作时基于最新观测预测下一步,避免前瞻漂移。

评测表现与泛化能力

在评测方面,模型在RoboTwin 2.0上取得93.6的平均分,超过π0.5等模型,且在干净与随机化场景下表现稳定。@HeyToha 补充指出,该模型在RBench基准上平均分达到0.620,在长时程任务、四足机器人控制等场景中整体领先。LingBot-VLA 2.0版本将不同机器人控制转化为统一的55维动作语言,成功覆盖手臂、灵巧手、底盘等20种机器人构型,并能仅用10-15个示范完成新环境适应。

2026-07-10 ~ 2026-07-12 · 24 条相关

一手来源

另有 2 条近重复转述:bendee983 · omarsar0