HumanCLAW 实测:最强 VLM 完成具身交互任务的比例仅 16.8%
jiqizhixin · x · 2026-09-13
Meta、南洋理工、华盛顿大学、布朗大学与西北大学联合提出 HumanCLAW,研究 VLM 能否真正"通过身体行动"而不只是描述所见。
框架要点:
- 将高层动作选择与底层运动控制分离,同时保留连续运动、碰撞、接触与重力物理
- 使用冻结的现成 VLM 从第一人称视角做决策,每步从参数化原子技能(前进、转身、坐下等)中选择
- 研究的是"做什么",关节如何动交给可靠底层控制器
结果:9 个前沿 VLM 在同一协议下测试,最好的模型也只完成 16.8% 的完整交互——理解世界不等于能行动于世界。项目已完全开源。
「具身」频道最新
- 一张图加一句描述,半小时做出 RL 机器人 demo — heatherknight · 2026-09-13
- 时间线被 GPT-6 Astra 控制机器人演示刷屏,物理 AI 成焦点 — CyberRobooo · 2026-09-13
- DLSS 5 让 Madden 画质十年首升级,玩家调侃可再躺十年 — chrisfirst · 2026-09-13
- 人形机器人把润滑机器人推走了,机器人互动名场面 — MatthewChang · 2026-09-13
- 宇树 G1 人形机器人执行器拆解:关节如何驱动运动 — ericjang11 · 2026-09-13
- 曝特斯拉押后发布 Optimus V3,防对手逐帧分析抄设计 — tekbog · 2026-09-13