Grounded Action Model:先3D定位再学动作的机器人基础模型新范式
DJiafei · x · 2026-09-22
研究者提出 Grounded Action Model (GAM),挑战「语言/视频模型是否是机器人基础模型的正确底座」这一假设。
核心灵感来自发展心理学(Hespos & Spelke 等的「语言的概念前驱」研究):婴儿并非先掌握语言再学会抓取探索,而是先在感知与行动中建立空间概念。GAM 主张机器人基础模型也可以「先定位,再学动作」——在预训练 3D grounding 模型之上构建,让预训练提供空间定位能力,机器人演示数据教出动作策略。
技术要点:
- 以预训练 3D grounding 模型(如 WildDet3D,也可用 SAM3D)定位任务物体并估计几何,backbone 冻结,只训练 action head
- 图像 token 保留被选物体与机械臂周边特征,detection token 编码物体点云与度量几何
- MM-DiT 融合两者与机器人状态历史、语言指令,生成 action chunks
- 动作指定支持三种方式:语言描述、点选、框选,降低语言歧义,让 VLM 直接引导机器人
论文、代码与项目页均已开源。
所属事件:新加坡国立大学提出 GAM:以 3D 定位为底座的机器人基础模型新范式(3 条相关)→
「具身」频道最新
- IROS 2026 落地匹兹堡:4000 人参会、近 2000 篇论文 — heatherknight · 2026-09-23
- Jim Fan 力挺视频训练机器人:称 VR 遥操作「不具可扩展性」 — dawnsongtweets · 2026-09-23
- 开发者用 Copilot CLI 给 AI Agent 造出 ESP32 桌面表情伴侣 — DanWahlin · 2026-09-23
- seeMote Cube 发布:Vision Pro 首个红外 6DoF 空间配件 — OwariDa · 2026-09-22
- 在 Isaac Sim 里估算 Unitree G1 关节发热:热损失可视化 — IsaiahBallah · 2026-09-22
- 清华与腾讯混元 RoboDawn:冻结 VLM 指令驱动机器人达 73.6% 成功率 — _akhaliq · 2026-09-22