Grounded Action Model:用 3D grounding 替代 VLA 构建机器人基础模型
DJiafei · x · 2026-09-23
研究团队发布 Grounded Action Model(GAM),提出构建机器人操作基础模型的新范式:不再把语言或视频模型当作机器人学的底座,而是基于预训练的 3D grounding 模型来搭建。
- 核心主张是「先 grounding,再学行动」(Ground first, then learn to act),质疑 VLA(视觉-语言-动作)与 WAM 等以语言/视频为基础的路线是否适合机器人操作
- 作者称 3D grounding 能让操作能力更强、泛化性更好
- 团队以长推线程形式展开技术细节
所属事件:GAM:以3D定位为底座的机器人基础模型新范式(6 条相关)→
「具身」频道最新
- eidon-ai 发布 tracker-pov 机器人视频数据集,规模 1 万至 10 万条 — eidon-ai · 2026-09-23
- 开发者把 90 年代旧电视改造成 AI 电视:树莓派+摄像头+GPT 实时 API — OpenAIDevs · 2026-09-23
- 机器人任务实测:GPT-6 推理越强操作越好,成本差 30 倍 — YuXiang_IRVL · 2026-09-23
- 新方法无需重训即可引导 VLA 机器人模型,抓握成功率 14% 升至 74% — drmapavone · 2026-09-23
- 前沿模型可操控机器人执行有害指令,如混合清洁剂产生毒气 — ycombinator · 2026-09-23
- 零样本操控真人形机器人:全身追踪让 agent 直接做开放抓放任务 — ai · 2026-09-23