GAM:以 3D grounding 为底座的机器人基础模型范式,LIBERO-PRO 达 61%
DJiafei · x · 2026-09-22
Jiafei Duan 等人提出 Grounded Action Model(GAM),质疑以语言/视频模型为底座的传统 VLA/WAM 路线,主张机器人基础模型应构建在预训练 3D grounding 模型之上——「先定位,再行动」。
方法
- 支持语言、点、框三种 prompt,先转成以目标物体为中心的共享表征,融合目标视觉特征与度量几何信息,再与机器人状态历史经多流 transformer 混合预测动作块。
- 可自主运行,也可作为底层控制器,由高层 planner(如 Molmo2,用点选目标)操控,支持长时程与记忆依赖任务。
成绩
- RoboTwin 2.0 共 50 任务:平均成功率 55.3%(Spatial Forcing 为 52.0%);随机场景下 47.6%(Abot-M0 为 30.4%),且动作策略仅用干净场景演示训练。
- LIBERO-PRO:16 种扰动设定平均 61%(π0.5 为 53%);目标切换场景下达 88% vs π0.5 的 1%。
- Franka 实机上 GAM+Molmo2:分布内步完成率 64.7%,分布外 49.8%。
局限:grounding 错误与上下文遗漏(如未选中障碍物)仍是挑战。论文、代码与项目页均已公开。
所属事件:新加坡国立大学提出 GAM:以 3D 定位为底座的机器人基础模型新范式(3 条相关)→
「具身」频道最新
- 预测:2029 年人形机器人产量或达数百万台,家庭普及要到 2030 年代初 — Rewkang · 2026-09-22
- 谷歌旗下 Intrinsic 开源 Intrinsic Core:面向工业机器人的 ROS 兼容 Physical AI 基础能力 — facontidavide · 2026-09-22
- MolmoAct2 开箱支持 SO-101 与 YAM,单双臂 VR 遥操作同步上线 — k7agar · 2026-09-22
- Quest 采集机械臂数据:passthrough 与 headless 双模式,自主与人工遥操作可切换 — k7agar · 2026-09-22
- GPT-6 Astra 免微调当机器人策略:成功率 22.48% 碾压全部公开方案 — ben_j_todd · 2026-09-22
- Hello Robot CEO 将在 TechCrunch Disrupt 2026 现场演示 Stretch 4 — TechCrunch AI · 2026-09-22