NUS 提出 GAM:用 3D 指引作底座,机器人操作成功率显著领先
NationalUniversityofSingapore · hf · 2026-09-22
新加坡国立大学提出 Grounded Action Models(GAM),一种以 3D 目标定位为核心的机器人基础模型新范式。现有 VLA/世界-动作模型的预训练底座并不直接要求度量级的目标定位,只能从机器人示教中隐式学习。GAM 支持语言、点、框三种条件输入,把所选目标转成共享的对象中心表征(含目标聚焦视觉特征与度量几何),再经多流 transformer 与机器人状态历史融合预测动作块;既可自主运行,也能充当被高层规划器调用的底层控制器,支持长程与记忆依赖操作。
关键结果:
- RoboTwin 2.0:50 个任务平均成功率 55.3%(Spatial Forcing 52.0%),场景随机化下 47.6%(Abot-M0 仅 30.4%),且动作策略只用干净场景示教训练
- LIBERO-PRO:16 种扰动设置平均 61% 超越 π0.5 的 53%,目标被移动或新指定时优势最大
- 真机:双臂 YAM 在视觉扰动下保住 17/20 成功(π0.5 仅 4/20);与 Molmo2 规划器组合在 Franka 上长程/记忆任务达 64.7% ID、49.8% OOD 步骤完成率
「具身」频道最新
- 无摄像头 AI 眼镜 VONDER 发布:骨传导麦克风,299 美元起预订 — alex_verem · 2026-09-22
- 机器人公司破局之道:先部署再用协同感知补能力短板 — broodsugar · 2026-09-22
- 机器人 Astra 自主给自己的身体装上新模块,作者直呼意外 — mhmazur · 2026-09-22
- 「可提示硬件」探索:让 AI agent 住进日常物品的 50 个概念 — genmon · 2026-09-22
- iRobot 破产后,前三星工程师开源扫地机器人 OOMWOO 44 天获千星 — Aiden_Tech_Ai · 2026-09-22
- 微软 ShieldVLA 用 HJ 可达性做 VLA 安全对齐,安全成本平均降 57% — MicrosoftResearch · 2026-09-22