ReactHuman 基准发布:多模态 LLM 面对家庭突发危险反应持续失灵
Yizhan Li · hf · 2026-09-15
Yizhan Li 在 Hugging Face 发布 ReactHuman,一个以物理规律为基础的 benchmark,用于评测多模态大模型作为仿真人形机器人「决策核心」的表现。
- 场景设定:人形机器人在家庭环境中遭遇突发危险( household hazards),需要做出类人的即时反应决策。
- 评测揭示了多模态 LLM 在「反应式安全决策」上的持续性失败,即模型难以像人一样对突发物理风险做出正确响应。
「具身」频道最新
- Physical Intelligence 发布 OM-1:首个零样本泛化机器人基座模型 — zipengfu · 2026-09-15
- Pi 机器人在巧克力工厂全自主码箱数小时,最难点意外是码垛 — chelseabfinn · 2026-09-15
- 北大发布 MobileVLA-R1 2.0:强化学习增强移动机器人操控 — PekingUniversity · 2026-09-15
- X Humanoid 推出 Pelican-Sim 1.0 通用世界模型仿真器 — X-Humanoid · 2026-09-15
- General Robotics 转向推销可自动化机器人开发的 AI 工具 — VraserX · 2026-09-15
- 果蝇大脑完整接线图驱动无人机:16.7万神经元实时操控飞行 — anselm · 2026-09-15