全开源机器人模型 MolmoAct 2 登顶 Reality Check 动态鲁棒性榜
DJiafei · x · 2026-09-30
AI2 的全开源机器人模型 MolmoAct 2 经任务微调后,在独立评测 Reality Check benchmark 上取得整体任务成功率第一。
新发布的 LIBERO-MAX benchmark 关注「执行中世界突变」的动态鲁棒性:机器人在行动开始后遭遇环境变化(目标物/容器位移、视角变化、传感器损坏、光照突变、干扰物涌入、障碍插入等 8 类事件,每类 1000 个匹配用例),衡量任务成功是否得以保持。与测试静态泛化的 LIBERO-Plus、LIBERO-PRO 不同,它只测变化后的结果,不推断内部是否感知或刻意重规划。
作者引用 Nicolas Keller 的评测与微调方法,称 MolmoAct 2 在此场景下依然能优雅泛化。
「具身」频道最新
- 机器人手术数据研究揭示:模型可能「记住」数据生成者的习惯 — bravo_abad · 2026-09-30
- DoorDash 将支持用 AI 下单 Chipotle 并由无人机配送 — Polymarket · 2026-09-30
- 机器人工程师建议:sensormaxxing——每个刚体装 IMU,每个关节装编码器 — _Stocko_ · 2026-09-30
- Bloomberg 深入机器人竞赛:Boston Dynamics 联手现代汽车内幕 — 141_1337 · 2026-09-30
- Alex Kendall 感慨:机器人距费德勒的球技还差得很远 — alexgkendall · 2026-09-30
- UCL 发布 AMB3R-SLAM:消费级 GPU 实时重建公里级轨迹,误差降 70% — rsasaki0109 · 2026-09-30