RoboHarm 基准开源:任意 LLM/VLA 跑任意机械臂与人形机器人评测
chooi_jeq · x · 2026-09-19
作者发布 RoboHarm 基准及 300 条轨迹数据,并开源配套评测框架 inspect-robots(GitHub 上已有 544 星)。框架思路类似 Inspect AI,但面向物理 AI:定义一次机器人基准后,可将任意策略(LLM agent 或 VLA)运行在任意本体上——真实机械臂、人形机器人或模拟器——并输出可审计日志(评分、LLM 对话记录、完整配置),内置 Rerun 可视化。项目处于早期开发阶段,API 可能变动,官方建议锁定版本使用。
所属事件:RoboHarm 基准显示前沿机器人模型几乎不拒危险指令(2 条相关)→
「具身」频道最新
- Zeno AI 展示人形机器人协作:仅 4 小时机器人交互数据学会配合 — CyberRobooo · 2026-09-20
- GAVEL:不改模型,仅靠 harness 把 Qwen3-8B 从 41.2% 提到 91.8% — dair_ai · 2026-09-20
- 马斯克确认每颗 Starlink V3 卫星搭载英伟达 Vera Rubin NVL72 — ns123abc · 2026-09-20
- Odyssey-3:数十小时示教数据让单一世界模型适配多种机械臂 — ChongZzZhang · 2026-09-20
- iPhone 18 Pro 主板仅重 13.1g,算力已达 PC 级别 — SumitGup · 2026-09-20
- Daniel Lemire 解析:Apple Silicon 为何三年快了 50% — ibobev · 2026-09-20