LIBERO-MAX 评测:环境中途一变,所有机器人策略成功率掉 11-26 个百分点

机器之心 · wechat · 2026-10-11

Stanford、CMU、MIT、UIUC、UT Austin 等机构的研究者提出机器人评测基准 LIBERO-MAX,研究世界在任务执行中途发生变化时机器人策略能否适应。该工作入选 NeurIPS'26 Robotics World Modeling Workshop 口头报告。

基准设计了配对评测:同一任务两次执行在变化前完全一致,之后一组保持不变(Base)、一组加入 8 类中途变化(Dynamic),共 8,000 组配对案例,可区分「本来就不行」与「被变化打断」。评测 14 种策略(VLA、混合架构、世界动作模型)累计 22.4 万次仿真,结果显示所有策略成功率下降 11.0–25.7 个百分点,表现最好的 MolmoAct2 和 π₀.₅ 也只有约 66%;目标/容器移动和相机变化最难,更频繁地重新观测并不能消除差距。

团队还验证了针对性改进:在 X-VLA 前加入图像质量检测与修复模块,可把变化后成功率从 40.7% 提升至 47.7%。基准代码、固定案例清单和含 800 组案例的 Lite 版已开源。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →