3.7万小时预训练三系统VLA,人形机复杂操作成功率74%

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

cs.RO

2026-08-17

GigaBrain-0.7把理解、预测、动作拆成三系统,用3.7万小时、16种本体做单阶段预训练;后训练后Maker H01复杂操作成功率74.1%,对照π0.5的45.2%。

这篇在解决什么

主流 VLA(Vision-Language-Action,视觉-语言-动作模型)把预训练视觉语言模型接到动作头上,观察加指令直接出控制量。桌面短程任务已经能跑,扩到异构数据和长程真机时会卡三处。

数据侧,不同本体的自由度、坐标系、频率对不齐,混训容易互相干扰。模型侧,多数系统仍是「看见什么就立刻出手」的反应式策略,缺少对未来画面的显式预测,也缺少「这一步有没有把任务往前推」的进度判断。训练侧,理解、预测、动作、部署后纠错常常被拆成互不相通的阶段。GigaBrain-0.7 要把这四件事收进同一套生命周期。

方法

三套系统分工,接口写死。

数据是这篇真正的体量。清洗后具身轨迹 37,257 小时,覆盖 16 种机器人:真机 20,536 小时(55%)、UMI 近手演示 8,252 小时、第一人称人体 2,862 小时、仿真 1,454 小时、世界模型生成 4,153 小时;另加 2.72 亿条视觉语言样本。真机帧数里自家 Maker H01 占 43.8%,Maker M01 占 20.1%。全部转成 LeRobot v3.0,状态动作按左臂-右臂-头-腰-底盘对齐,缺的维度用 mask 占位。

训练是单阶段联合优化:语言、子任务、离散动作走 NTP 损失,连续动作走 flow matching。为了不把 VLM 的语义表征冲掉,flow matching 梯度进骨干时乘一个小于 1 的系数,这叫 Soft Knowledge Insulation。后训练冻结 System 3,把子目标图和进度条件喂给 System 1;推理时强制条件为正进度。再往后,用自己的 rollout 做离线优势加权回归,然后人在环上线强化学习。

结果

先定架构。PaliGemma2(总参 3.5B)在叠衣服上是唯一非零的骨干(30%),Gemma 4 8.5B 叠衣服 0%。双流耦合在擦桌子、抓水果、叠衣服上分别 50%、88%、30%;最后一层或逐层 cross-attention 叠衣服都是 0%。

预训练直接上真机、不做任务微调,已经能干活,但分布外掉得很快:

平台语言跟随 ID / OOD复杂操作 ID / OOD
AgileX PiPER94.5% / 36.5%63.3% / 26.7%
Maker H0155.8% / 16.7%58.3% / 13.3%

按钮按压在两个平台的 OOD 上都是 0%。

任务微调之后,对比更清楚:

方法PiPER 语言 / 复杂H01 语言 / 复杂
π0.588.8% / 76.6%75.2% / 45.2%
GigaBrain-0.176.1% / 64.8%69.6% / 43.2%
GigaBrain-0.791.5% / 84.9%84.2% / 74.1%

人形机复杂操作上,相对 π0.5 拉开近 29 个点。System 3 消融更直白:礼盒包装基线 0%,加子目标图 20%,加进度值 60%,两个一起 80%。叠衣服成功率已经饱和到 100% 时,进度分数仍从 68.3% 提到 88.3%,完成时间从 107 秒降到 75 秒。

仿真榜:RoboTwin 2.0 多任务 Co-Train 总体 67.35,Hard 设定 67.9,对照 π0.5 的 46.0;Easy 上 π0.5 仍高 3.9 点。EBench 成功率 33.30,对照 π0.5 的 28.08。RoboColiseum 四维全第一,指令跟随 0.8166、空间推理 0.4729。人在环 RL 把四项真机任务从 SFT 平均 30% 拉到离线 57.5%、在线 100%,每项配置大约 10 到 20 次试验。

为什么重要

对要训通用机器人策略的人,这篇把三件事钉死了。异构数据能一起训,前提是统一表示加上 Soft KI,动作梯度不必全挡住。反应式 VLA 不够:显式的未来图像和进度信号,能把礼盒包装从 0% 拉到 80%。规模对可变形物体特别敏感,叠衣服随数据比例陡升,抓水果则平滑得多。作者把这叫涌现,更贴近的说法是难技能的覆盖率阈值。

代码和权重承诺开源。能直接拿来用的,是数据管线(LeRobot v3.0、跨本体 mask、LLM 改写指令)和后训练时把世界模型冻住当条件器的做法。π0.5 在 PiPER 语言跟随上只差 2.7 点,差距主要出现在人形机和 Hard 仿真。

局限与存疑

作者自己写出了 ID-OOD 落差:语言跟随从 94.5% 掉到 36.5%(PiPER)、从 55.8% 掉到 16.7%(H01)。按钮这类交互结构变了的任务,零样本直接归零。接触密集任务也远没饱和,PiPER 扫米只有 40%。

RoboTwin Easy 上 π0.5 仍领先。真机数据高度偏向自家本体。System 3 后训练阶段冻结,没有和策略联合更新。在线 RL 的 100% 带着人在环纠正,完整协议被推到后续报告,试验次数也偏少。骨干放大并不单调有效,8.5B 的 Gemma 4 叠衣服失败。双流推理 0.221 秒,比最后一层 cross-attention 的 0.073 秒贵三倍。

「涌现」写在标题里,实验给出的是数据量与难任务成功率的陡峭关系,不是突然出现的新能力类别。

术语

原文与代码

社区讨论

相关论文

全部论文解读