蚂蚁灵波开源LingBot-VLA 2.0实现一脑多机

蚂蚁集团旗下具身智能企业蚂蚁灵波正式发布并开源了 LingBot-VLA 2.0 视觉-语言-动作(VLA)基座模型。该模型直击具身智能领域“一脑多机”的跨构型泛化难题,实现了单一模型驱动多种机器人本体,并进一步强化了在真实物理任务中的实用能力。

关键技术与数据规模

LingBot-VLA 2.0 模型规模为 6B,采用 Apache 2.0 开源协议。其预训练数据量达到约 6 万小时,包含 5 万小时真实机器人轨迹和 1 万小时第一视角人类操作视频。在技术架构上,该模型采用稀疏 MoE 设计和 token 级 MoE 动作头,结合多教师蒸馏,在相同激活参数预算下实现了更高的训练效率和更低的误差。此外,模型引入了因果世界建模与未来预测能力,通过联合视频-动作建模实现“边预测下一步、边规划动作”。

跨构型泛化与实测表现

该模型将动作空间扩展至头部、腰部、末端执行器和移动底盘等全身自由度,成功将国内外 17 个主流品牌(如宇树、智元、乐聚、星尘等)的 20 种不同机器人构型统一到同一动作空间中。在实测中,单一训练策略可全自主驱动从 Franka 单臂到 Fourier GR-2、Unitree G1 人形机器人。在双手协作操作和长时程移动操作任务中,其成功率和任务进度均优于上一代及现有部分模型。

2026-07-08 ~ 2026-07-10 · 18 条相关

一手来源

另有 1 条近重复转述:新智元