Grounded Action Model: 3D Grounding as a Foundation for Robotics
Gehao Zhang, Weikai Huang, Shailesh Shailesh, Yiyan Peng, Jiafei Duan, Ranjay Krishna
cs.RO
2026-09-21
华盛顿大学与西北大学把可提示 3D 检测器 WildDet3D 冻住当机器人底座,语言、点和框先变成物体中心的外观加度量几何,再预测关节动作。RoboTwin 随机场景 47.6%,对照 Abot-M0 的 30.4%;真机视觉偏移下 17/20,π0.5 只剩 4/20。
现在的机器人基础模型,底座要么来自视觉语言模型,要么来自视频生成。这两类预训练都不强制回答「东西在三维空间的哪里、有多大」。度量定位被留给有限的机器人演示去偷偷学。布局一变、背景一换、目标一换, visuo-motor 记忆就失效。
这篇提出 Grounded Action Model:先用可提示 3D 检测把任务物体钉在度量空间里,再在这个物体中心表示上学生控。语言、2D 点、2D 框三种提示走同一条观察通路。
语言指令先用 Flan-T5 抽物体短语,点和框则直接指定物体。冻结的 WildDet3D 输出 2D 框、度量 3D 框和深度图。图像 token 只保留覆盖目标或机械臂的 16×16 网格,其余置零。检测 token 把框内点云(512 点)编成形状特征,再拼上中心、尺寸、旋转。关节历史压成一个状态 token。四路 MM-DiT 用 flow matching 预测绝对关节位置块。策略训练时检测器始终冻结。
部署时 CoTracker3 在初始框内跟点,保持跨帧身份。高层规划器(Molmo2)可以在子任务切换时用点重新指定目标,动作头不用改。
RoboTwin 上检测器先用仿真器导出的框和深度做一次域适应,再冻结;动作头按任务用 50 条干净场景演示训练,测试含未见过的随机场景。
RoboTwin 2.0 共 50 个双臂任务,干净/随机各 100 次 rollout。
| 方法 | 干净 | 随机 | 平均 |
| GAM(单任务) | 63.0% | 47.6% | 55.3% |
| Spatial Forcing(共训) | 77.2% | 26.7% | 52.0% |
| Abot-M0 | 57.4% | 30.4% | 43.9% |
| π0.5(单任务) | 64.0% | 25.9% | 45.0% |
| FastWAM | 77.8% | 1.9% | 39.9% |
| DP3 | 55.2% | 5.0% | 30.1% |
干净场景 GAM 不是最高,随机场景它把次优的 30.4% 拉到 47.6%,保住干净成绩的 76%。LIBERO-PRO 16 组扰动平均 0.61,π0.5 为 0.53。目标被挪走或被改指时差距最大:Spatial-Pos 0.60、Spatial-Task 0.88,基线几乎全线崩溃。物体外观尺寸扰动上 GAM 反而落后,Goal 套件 0.69、LIBERO-10 的 Obj 仅 0.50。
双臂 YAM 上分布内双方都是 19/20;视觉偏移后 GAM 17/20,π0.5 4/20。Franka 上接 Molmo2 规划器,分布内步骤完成率 64.7%,分布外 49.8%;π0.5 分布外 24.0%,MolmoAct2 17.1%。消融里拿掉图像掩膜或点云裁剪,10 任务平均从 46.8% 掉到 22.3% 和 12.8%;只留检测或只留图像分别 16.0% 和 20.3%。
机器人基础模型的预训练目标,可以不是「会说话」或「会做梦」,而是「把被点名的物体放到度量坐标里」。随机化和换目标时,观察跟着检测走,策略不用靠背景相关。点和框接口让人点一下或规划器点一下就能换目标,长程记忆放在规划器,不塞进动作头。对要在杂乱桌面上泛化的操作策略,这是比再堆演示更对症的归纳偏置。干净场景它并不赢共训 VLA/WAM,赢在扰动。
检测错了,动作没有自救。物体中心过滤会丢掉未选中的障碍物。RoboTwin 的检测器在仿真器标签上做过域适应,随机场景的增益有多少来自这次适应、有多少来自物体中心过滤,没有完全拆开。LIBERO-PRO 上换尺寸时抓取跟不好。真机对照里 GAM 用点/框,π0.5 用语言,接口并不对称。3D 框也偏粗,论文自己说实例分割可能更细。