HumanCLAW 开源:9 个前沿 VLM 具身测试全军覆没,最高仅 16.8%

liuziwei7 · x · 2026-08-18

具身智能评测框架 HumanCLAW 已完全开源(GitHub: Human-CLAW/HumanCLAW)。其核心思路是把 VLM 的「动作智能」与底层运动控制解耦:每一步由现成 VLM 输出一个原子全身技能,再由带真实物理后果(接触、碰撞、重力)的连续动作执行,同时剔除平衡与运动跟踪失败的影响,从而单独度量模型的行动决策能力。

配套的 HumanCLAW-Bench 提供 1,218 个长时程第一视角「寻找–导航–交互」任务,覆盖 41 个室内场景。测试的 9 个 SOTA VLM 无一通过,最好的模型成功率仅 16.8%——当前 VLM 缺乏具身自我认知。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →