VA-Bench 实测:最强模型具身操作任务成功率仅 53.9%

dalian-university-of-technology · hf · 2026-09-18

大连理工大学发布 VA-Bench,评测 MLLM 在不完全观测下的完整「观察-推理-行动-修正」具身闭环:模型需主动选择相机视角、下达米制笛卡尔坐标指令,并根据执行反馈修正,不获得任何特权物体位姿或 oracle 轨迹。

基准包含 14 个基础任务族(11 单臂、3 双臂)、7 个 held-out 几何/布局变体和长时程五物体组合轨道,12 个模型条件各跑 3 次独立评测。核心发现:

结论是通用 MLLM 距离把视觉演示与主动获取的证据转化为成功具身动作仍有很大差距。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →