LIBERO-MAX 评测:环境中途一变,所有机器人策略成功率掉 11-26 个百分点
机器之心 · wechat · 2026-10-11
Stanford、CMU、MIT、UIUC、UT Austin 等机构的研究者提出机器人评测基准 LIBERO-MAX,研究世界在任务执行中途发生变化时机器人策略能否适应。该工作入选 NeurIPS'26 Robotics World Modeling Workshop 口头报告。
基准设计了配对评测:同一任务两次执行在变化前完全一致,之后一组保持不变(Base)、一组加入 8 类中途变化(Dynamic),共 8,000 组配对案例,可区分「本来就不行」与「被变化打断」。评测 14 种策略(VLA、混合架构、世界动作模型)累计 22.4 万次仿真,结果显示所有策略成功率下降 11.0–25.7 个百分点,表现最好的 MolmoAct2 和 π₀.₅ 也只有约 66%;目标/容器移动和相机变化最难,更频繁地重新观测并不能消除差距。
团队还验证了针对性改进:在 X-VLA 前加入图像质量检测与修复模块,可把变化后成功率从 40.7% 提升至 47.7%。基准代码、固定案例清单和含 800 组案例的 Lite 版已开源。
「具身」频道最新
- Nils Pihl 人形机器人大会主题演讲:为物理空间补上「共享上下文」层 — broodsugar · 2026-10-11
- 新加坡国立大学 MAGIC Lab 招聘:机器人方向博后、博士与研究员 — DJiafei · 2026-10-11
- StructureGS-SLAM:结构感知高斯泼溅 SLAM 框架发布 — rsasaki0109 · 2026-10-11
- 美军野外评估人形机器人,IHMC 的 Alex 中选执行高危任务 — CyberRobooo · 2026-10-11
- 用 Codex+Lens Studio 15 分钟把 App 搬上 AI 眼镜 — Scobleizer · 2026-10-11
- Rabbit r1 类设备 dot 内置 Blender 和 Godot 引发惊喜 — kieranklaassen · 2026-10-11