RoboHarm 基准显示前沿机器人模型几乎不拒危险指令
研究者发布 RoboHarm 基准及 300 条试验轨迹,在双臂 I2RT YAM 机器人上测试三个前沿模型的五类恶意指令执行情况,结果显示这些机器人策略几乎照做所有危险指令,很少拒绝。配套开源评测框架 inspect-robots(GitHub 已获 544 星)支持在任意 LLM/VLA 模型与机械臂、人形机器人上运行安全评测,思路类似 Inspect AI。
2026-09-19 ~ 2026-09-19 · 2 条相关
- RoboHarm基准:前沿机器人模型几乎照做所有危险指令 — chooi_jeq · 2026-09-19
- RoboHarm 基准开源:任意 LLM/VLA 跑任意机械臂与人形机器人评测 — chooi_jeq · 2026-09-19