冻结3D检测器当底座,随机场景成功率47.6%

Grounded Action Model: 3D Grounding as a Foundation for Robotics

Gehao Zhang, Weikai Huang, Shailesh Shailesh, Yiyan Peng, Jiafei Duan, Ranjay Krishna

cs.RO

2026-09-21

华盛顿大学与西北大学把可提示 3D 检测器 WildDet3D 冻住当机器人底座,语言、点和框先变成物体中心的外观加度量几何,再预测关节动作。RoboTwin 随机场景 47.6%,对照 Abot-M0 的 30.4%;真机视觉偏移下 17/20,π0.5 只剩 4/20。

这篇在解决什么

现在的机器人基础模型,底座要么来自视觉语言模型,要么来自视频生成。这两类预训练都不强制回答「东西在三维空间的哪里、有多大」。度量定位被留给有限的机器人演示去偷偷学。布局一变、背景一换、目标一换, visuo-motor 记忆就失效。

这篇提出 Grounded Action Model:先用可提示 3D 检测把任务物体钉在度量空间里,再在这个物体中心表示上学生控。语言、2D 点、2D 框三种提示走同一条观察通路。

方法

语言指令先用 Flan-T5 抽物体短语,点和框则直接指定物体。冻结的 WildDet3D 输出 2D 框、度量 3D 框和深度图。图像 token 只保留覆盖目标或机械臂的 16×16 网格,其余置零。检测 token 把框内点云(512 点)编成形状特征,再拼上中心、尺寸、旋转。关节历史压成一个状态 token。四路 MM-DiT 用 flow matching 预测绝对关节位置块。策略训练时检测器始终冻结。

部署时 CoTracker3 在初始框内跟点,保持跨帧身份。高层规划器(Molmo2)可以在子任务切换时用点重新指定目标,动作头不用改。

RoboTwin 上检测器先用仿真器导出的框和深度做一次域适应,再冻结;动作头按任务用 50 条干净场景演示训练,测试含未见过的随机场景。

结果

RoboTwin 2.0 共 50 个双臂任务,干净/随机各 100 次 rollout。

方法干净随机平均
GAM(单任务)63.0%47.6%55.3%
Spatial Forcing(共训)77.2%26.7%52.0%
Abot-M057.4%30.4%43.9%
π0.5(单任务)64.0%25.9%45.0%
FastWAM77.8%1.9%39.9%
DP355.2%5.0%30.1%

干净场景 GAM 不是最高,随机场景它把次优的 30.4% 拉到 47.6%,保住干净成绩的 76%。LIBERO-PRO 16 组扰动平均 0.61,π0.5 为 0.53。目标被挪走或被改指时差距最大:Spatial-Pos 0.60、Spatial-Task 0.88,基线几乎全线崩溃。物体外观尺寸扰动上 GAM 反而落后,Goal 套件 0.69、LIBERO-10 的 Obj 仅 0.50。

双臂 YAM 上分布内双方都是 19/20;视觉偏移后 GAM 17/20,π0.5 4/20。Franka 上接 Molmo2 规划器,分布内步骤完成率 64.7%,分布外 49.8%;π0.5 分布外 24.0%,MolmoAct2 17.1%。消融里拿掉图像掩膜或点云裁剪,10 任务平均从 46.8% 掉到 22.3% 和 12.8%;只留检测或只留图像分别 16.0% 和 20.3%。

为什么重要

机器人基础模型的预训练目标,可以不是「会说话」或「会做梦」,而是「把被点名的物体放到度量坐标里」。随机化和换目标时,观察跟着检测走,策略不用靠背景相关。点和框接口让人点一下或规划器点一下就能换目标,长程记忆放在规划器,不塞进动作头。对要在杂乱桌面上泛化的操作策略,这是比再堆演示更对症的归纳偏置。干净场景它并不赢共训 VLA/WAM,赢在扰动。

局限与存疑

检测错了,动作没有自救。物体中心过滤会丢掉未选中的障碍物。RoboTwin 的检测器在仿真器标签上做过域适应,随机场景的增益有多少来自这次适应、有多少来自物体中心过滤,没有完全拆开。LIBERO-PRO 上换尺寸时抓取跟不好。真机对照里 GAM 用点/框,π0.5 用语言,接口并不对称。3D 框也偏粗,论文自己说实例分割可能更细。

术语

原文与代码

相关论文

全部论文解读