VA-Bench 实测:最强模型具身操作任务成功率仅 53.9%
dalian-university-of-technology · hf · 2026-09-18
大连理工大学发布 VA-Bench,评测 MLLM 在不完全观测下的完整「观察-推理-行动-修正」具身闭环:模型需主动选择相机视角、下达米制笛卡尔坐标指令,并根据执行反馈修正,不获得任何特权物体位姿或 oracle 轨迹。
基准包含 14 个基础任务族(11 单臂、3 双臂)、7 个 held-out 几何/布局变体和长时程五物体组合轨道,12 个模型条件各跑 3 次独立评测。核心发现:
- 最佳模型目标定位可达 100.0%、空间关系 78.9%,但三次运行宏平均任务成功率仅 53.93±3.17%
- 主动相机控制显著优于被动多视角观测:一组对照实验中成功率从 27.86% 提升到 57.50%
- held-out 几何迁移可使成功率下降超 30 个百分点
- 没有任何模型完成严格的长时程回合
结论是通用 MLLM 距离把视觉演示与主动获取的证据转化为成功具身动作仍有很大差距。
「具身」频道最新
- NewEyes AI 登陆 Meta 眼镜:本地轻处理+云端深推理分工 — rohanpaul_ai · 2026-09-18
- DARPA 手术 AI 竞赛正式开赛,从业者类比当年自动驾驶挑战赛 — Laparoscopes · 2026-09-18
- 纯 Rust 实现视觉/视觉惯性 SLAM 与定位,visloc-rs 开源 — rsasaki0109 · 2026-09-18
- Scoble 爆料:一款无摄像头无屏幕的全天候 AI 眼镜下周发布 — Scobleizer · 2026-09-18
- Waymo 宣布扩张至第二个亚洲城市,自动驾驶出海提速 — reed · 2026-09-18
- SceneAgent:将 3D 采集自动转为物理仿真场景,供机器人策略训练 — hankyang94 · 2026-09-18