九个前沿 VLM 接管人体全身动作,最强的也只完成 16.8%

HumanCLAW: Can Vision-Language Models Act Through a Body?

Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

cs.CV, cs.RO

2026-07-30

提出半物理仿真基准 HumanCLAW,让 VLM 用原子技能驾驶人体完成导航坐下;九个前沿模型里最强的(Gemini-3.1)也只到 16.8% 成功率,全部不及格。

这篇在解决什么

现有对视觉语言模型(VLM)的评测,要么干脆不让它动(纯感知题),要么把决策和动作控制搅在一起做端到端训练,看不出模型本身的「行动智能」(action intelligence)到什么水平,也就是它能不能一步步决定一个身体接下来该做什么。这篇想单独测这个能力,于是用仿真器把执行端的麻烦事(平衡、电机误差)屏蔽掉,只留下「看懂场景、决定身体下一步动作」这部分交给 VLM。

方法

HumanCLAW 给一个现成的 VLM 戴上「挽具」:它接收第一人称观察,输出原子技能指令,每个指令由底层的 Motion Base DiT(3800 万参数)实现成一段不到一秒、带真实物理后果的全身动作。仿真器是半物理的,保留碰撞、接触、重力,但去掉平衡和电机失败,这样失败就归因于决策而不是执行。技能集包括走、侧移、后退、转身、上下楼梯、坐下、停止。配套的 HumanCLAW-Bench 有 1218 段第一人称全身片段,分布在 41 个室内房间,任务是「找到目标物体、走过去、坐在上面」,并按距离、岔路、障碍三个维度分难度。

结果

测了九个前沿 VLM(GPT-5.5、Gemini-3.1、Claude-4.8 等),没有一个能解。最前的 Gemini-3.1 总成功率只到 16.8%。三个分项里,找到目标(FindSR)从 InternVL3.5 的低分到 Gemini-3.1 的 64.9%;导航(NavSR)最高 42.4%;坐下交互(InteractSR)最高就是 16.8%。感知基本没问题,目标进了视野几乎总能认出来;主要栽在「具身自我意识」上,模型判断不了自己到没到、身体相对场景在哪、有没有撞上东西。开源模型里 Gemma-4-31B 离前沿很近(58.1/28.7/11.1)。

为什么重要

它把一个抽象的「VLM 能不能具身行动」拆成了可量化的差距:感知到位了,卡点在自我定位和空间判断。对做具身智能的人,这指明了下一个要补的洞;对模型选型,它说明当下直接拿最强 VLM 去指挥机器人还有明显上限,别高估。作者认为给模型补身体感知的训练是「可解的」,这篇给的是基线。

局限与存疑

技能词表很小,坐下之外更复杂的操作没覆盖。半物理刻意去掉了平衡和电机,触觉通道也没仿真,撞到东西只是位移、没有「感觉」。而且只测了冻结的现成 VLM,没有和专门拟合的动作策略直接对比,「决策才是瓶颈」这个结论作者自己标注是工作假设,不是定论。

术语

原文与代码

相关论文

全部论文解读