具身智能新测试:顶级 VLM 缺乏身体感知,成功率仅 16.8%
metaresearch · hf · 2026-07-30
评估视觉语言模型(VLM)能否通过物理身体执行任务非常困难,因为任务的失败往往难以判定究竟是模型决策失误,还是底层运动控制(如失去平衡)出了问题。
本研究提出了 HumanCLAW 评估框架,将动作决策与底层执行完全解耦。在该框架下,VLM 每次发出原子技能指令,由系统转化为具有真实物理后果(包含重力和碰撞)的全身运动,从而剔除执行端干扰,纯粹测量模型的“动作智能”。
基于此,研究团队构建了包含 41 个室内场景、1218 个长周期任务的 HumanCLAW-Bench。对 9 个顶级 VLM 的测试表明,没有任何模型能通过测试,表现最好的模型成功率也仅为 16.8%。
研究发现,目标识别并非瓶颈,当前 VLM 最缺乏的是具身自我意识(embodied self-awareness):它们无法追踪自己的身体状态,经常搞不清自己所处的位置、是否到达目标或是否撞到了障碍物。
「具身」频道最新
- Waymo无人车新UI获赞:10倍提升,体验大幅改进 — brianwilt · 2026-07-30
- 具身智能基础设施公司Ropedia完成3000万美元融资 — liuziwei7 · 2026-07-30
- 开源自主无人机 Langostino:结合 ROS2 与强化学习 — tom_doerr · 2026-07-30
- 单次人类演示即学会用剪刀,新框架实现机器人灵巧工具操作 — HaozhiQ · 2026-07-30
- TurboVLA:消费级显卡实现 32Hz 机器人实时控制 — H-EmbodVis · 2026-07-30
- 揭秘机器人演示常见套路:夹爪预设物体伪装抓取 — chris_j_paxton · 2026-07-30