斯坦福三层架构让 GPT-6 Astra 攻克 RoboMME,成功率 79.13%
DJiafei · x · 2026-09-22
斯坦福 Bingao Chen、Haoquan Fang 与 C. Karen Liu 团队发布记忆增强机器人操作研究,探讨如何让机器人在当前视野之外行动(记住隐藏物体、跟随视频演示序列、统计动作次数等 RoboMME 基准任务)。
- 三层架构:System 1 是底层视觉-语言-动作模型(VLA)负责执行动作;System 2 由 GPT-6 Astra 做高层规划、生成可执行的子任务;System 1.5 是一个小的视觉-语言模型,专门监测子任务是否完成。
- 省钱关键:由小模型判断何时再次调用 Astra,把高频进度检查与昂贵的高层推理分开,避免每个动作块都发起一次 Astra 请求。
- 结果:在 RoboMME 官方 800 条测试片段、16 个任务上取得 79.13% 成功率,平均每段仅调用 Astra 3.63 次,平均单段时长 80.84 秒,接近 oracle 引导上界 GroundSG+Oracle 的 84.08%。
- 研究延续了团队此前 SAM2Act 关于空间记忆的工作,代码已开源。
「具身」频道最新
- 嫌弃 5 万美元商用转运车太贵,工程师自改扭扭车造 Robocart — uavbro · 2026-09-22
- Maxinsights 已录 200 万小时第一人称数据:机器人数据瓶颈正在消失 — ChrisGPT · 2026-09-22
- Cybercab 第 67 辆加入特斯拉奥斯汀 robotaxi 车队 — EricETesla · 2026-09-22
- 旧金山笼斗现场:机器人当众把人打趴 — Charuru · 2026-09-22
- 俄勒冈州立团队让多台人形机器人协作夹取搬运,无通信单策略 — tweetsatpreet · 2026-09-22
- 沙特 Ceer 发布 AI 设计概念机器人 Exobot — aziz4ai · 2026-09-22