LingBot-VA 2.0:面向机器人控制的原生预训练模型

蚂蚁集团旗下具身 AI 公司 Robbyant 推出了名为 LingBot-VA 2.0 的 video-action foundation model。与许多先用通用视频生成器打底再外挂动作模型的方案不同,该模型的整个技术栈从一开始就为机器人控制进行原生预训练。这一架构选择引发了业界对如何降低机器人示范成本以及提升控制效率的广泛关注。

关键设计与架构

据 rohanpaulai 的分析,LingBot-VA 2.0 的控制策略从起步就按因果方式训练,而非将双向视频模型后改为控制器。其视频流采用了 128 个路由专家、top-8 routing 和 1 个共享专家。在表征学习上,它放弃了单纯“重建像素”的视频 tokenizer 路线,转而让压缩状态对齐到冻结视觉模型的语义特征,并结合前向与反向动力学从帧间变化中注入信息。为避免模型仅学会复制相邻帧,训练中引入 Multi-Chunk Prediction,使用 3 个轻量 head 分别预测未来 1、2、3 个 chunk。

推理效率与实测结果

在系统效率方面,rohanpaulai 指出该模型通过蒸馏将每个 chunk 的推理压缩至 2 次 function evaluations,结合 FP8 TensorRT 等优化,实现了 6.5 倍的推理提速,控制频率可达 225Hz。在 RoboTwin 2.0 实测中,取得 93.6 的平均分(clean 为 93.8,randomized 为 93.4)。

外界解读

Divpradeep 在转发中认同,对于机器人控制而言,“控制原生预训练”的设计可能比单纯比拼参数量更具决定性意义。annbordetsky 在资源汇总帖中指出,该系统旨在应对机器人身体、任务或环境变化时传统策略需昂贵示范的痛点,试图大幅降低相关成本。

2026-07-12 ~ 2026-07-14 · 9 条相关

一手来源