定位满分任务成功率只有一半,VA-Bench 拆开具身空间智能闭环

VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control

Zhongbo Zhang, Jiayi Jin, Yifan Wang, Zaibin Zhang, Haiwen Diao, Lijun Wang, Huchuan Lu

cs.RO, cs.CV

2026-09-17

VA-Bench 让通用多模态模型从 RGB 演示学流程、主动选视角并下毫米级笛卡尔指令。最强模型定位 100%,三轮任务成功率只有 53.93%。

这篇在解决什么

现有空间评测大多停在看图说话。给一张或多张固定视角,问物体在哪、谁在谁左边,答对了就算空间智能。真去抓东西时,接触面会被挡住,像素位移也换不成世界坐标里的毫米运动。

机器人基准则常自带物体位姿、预定义技能或学好的动作头,测的是策略执行,不是通用多模态大模型自己把空间判断写成可执行指令。VA-Bench 把这两段焊回一条闭环:自己决定看哪、自己估几何、自己下笛卡尔指令,再根据执行结果改下一拍。

方法

环境是 RoboTwin 物理仿真。14 个任务族,11 个单臂、3 个双臂,覆盖抓取、放置、工具接触和双手协作;每个族 20 个物理验证过的确定性种子。另有 7 个改几何或布局的留出变体,以及一条五物体长程组合轨。

模型只看到 RGB、过滤后的本体感觉,和自己从成功演示里写出的文本流程。演示不含轨迹、位姿或接触标签。动作是参数化的:世界轴平移 1–100 mm、夹爪局部旋转 1–90 度、开合;相机是夹爪为中心的语义视角加有界微调。相机和机械臂共用同一动作预算。执行器是固定、与模型无关的逆解与轨迹层,只跑模型给出的目标,没有学好的动作头。

主指标是物理检查器的终端成败,三轮独立重复。辅以 9 项轨迹诊断,三人多数投票,把失败钉在感知、规划还是恢复。

结果

最强条件是 Qwen3.8-max,14 任务宏平均 53.93±3.17%。Opus-5 是 52.86±2.79%,GPT-5.6-sol 是 51.55±4.31%,三轮区间重叠,排不出可靠名次。单臂 Qwen 到 65.61%,双臂最好的 GPT-5.6-sol 也只有 22.22%。第三名之后断崖:GPT-5.6-terra 23.10%,其余不超过 15%。

诊断更硬。标注轮次里最强模型目标定位 100.0%、操作语义至少 99.6%,空间关系只有 78.9%。找得到物体,估不准它和夹爪的几何。在线纠正更弱:Qwen 46.7%,Opus-5 32.4%。三人标注一致率 95.7%,Fleiss κ 0.942。

主动相机对照里,Qwen 从被动五视角的 27.86% 升到 57.50%。放置任务掉得最狠:placecubeinbowl 从 85% 掉到 5%。几何迁移上 GPT-5.6-sol 从 80.00% 掉 32.14 个点;Qwen 只掉 10 个点,到 67.86%。长程五物体没有模型跑完全程,最多放对 61/100。

条件成功率对照
Qwen3.8-max 主动相机57.50%同模型被动五视角 27.86%
Qwen3.8-max 三轮宏平均53.93±3.17%定位诊断 100.0%
GPT-5.6-sol 留出几何47.86%匹配基线 80.00%

演示摘要也不能随便换作者。Qwen 自己写的摘要让另外四个模型平均掉 31.25 个点,最大一刀砍在 GPT-5.6-sol 身上,51.67 个点;Opus-5 的摘要反而帮弱模型,平均 +7.50。

为什么重要

给做具身和空间模型的人一把更狠的尺子:能指对物体不等于能把杯子放进碗。主动看比一次塞五张图更有用,缺的是「这一步该看哪」,不是视野覆盖面积。这是评测贡献,不是新控制器。本地 27B/31B 级模型即使用强摘要,放置和双臂仍接近零。

局限与存疑

仿真、虚拟相机、固定执行器,都不是真机。主动优于被动的机制论文自己说还没钉死,可能是视角相关,也可能是跨视角融合。双臂和长程几乎没打穿,三条最强模型分不出伯仲。摘要迁移只做了三个任务一轮,排序只能当趋势。小模型的成功全挤在抓取,这套接口对弱骨干仍然过硬。

术语

原文与代码

相关论文

全部论文解读