具身智能新测试:顶级 VLM 缺乏身体感知,成功率仅 16.8%

metaresearch · hf · 2026-07-30

评估视觉语言模型(VLM)能否通过物理身体执行任务非常困难,因为任务的失败往往难以判定究竟是模型决策失误,还是底层运动控制(如失去平衡)出了问题。

本研究提出了 HumanCLAW 评估框架,将动作决策与底层执行完全解耦。在该框架下,VLM 每次发出原子技能指令,由系统转化为具有真实物理后果(包含重力和碰撞)的全身运动,从而剔除执行端干扰,纯粹测量模型的“动作智能”。

基于此,研究团队构建了包含 41 个室内场景、1218 个长周期任务的 HumanCLAW-Bench。对 9 个顶级 VLM 的测试表明,没有任何模型能通过测试,表现最好的模型成功率也仅为 16.8%。

研究发现,目标识别并非瓶颈,当前 VLM 最缺乏的是具身自我意识(embodied self-awareness):它们无法追踪自己的身体状态,经常搞不清自己所处的位置、是否到达目标或是否撞到了障碍物。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →