RoboQuest 基准:最强多模态智能体具身探索成功率仅 23%
declare-lab · hf · 2026-10-08
declare-lab 发布 RoboQuest,一个考察「目标导向具身探索」的基准:智能体必须通过物理交互主动获取任务相关信息、据此调整后续动作,并自主决定何时完成任务。
- 任务设计:10 个移动操作任务,围绕三种不确定性——搜索、基于操作的检查、交互式测试。
- 结果惨淡:五个前沿多模态智能体中最好的成功率仅 23%,在全剧集示范上微调的 π0.5 策略几乎从不成功。
- 失败归因:执行能力本身不是主因(隐藏信息给足后智能体能完成大部分动作);主要失败模式是探索过早停止——在观察到完成任务所需证据之前就做决策,且很少预防或修复探索造成的干扰;试错学习对大多数模型依然困难。
- 数据集与全剧集示范已开源发布。
「具身」频道最新
- NVIDIA Long-WAM:扩展世界-动作模型上下文,动态堆杯成功率 95% — nvidia · 2026-10-08
- RobotWorld 基准:84 个物理任务测试多模态机器人智能体 — Zhiqin Yang · 2026-10-08
- 日本 Donut Robotics 人形机器人进养老院,百余家护理机构试点 — CyberRobooo · 2026-10-08
- Reality Check 基准同任务同数据对比 π0.5 与 MolmoAct2 — Stefania_druga · 2026-10-08
- 机械臂末端执行器没有标准答案:简单夹爪 vs 人形灵巧手的深度拆解 — _Stocko_ · 2026-10-08
- UMI 数据采集 8 周从 5 人扩到 90 人,任务超百万 — HildeKuehne · 2026-10-08