RoboHarm 基准显示前沿机器人模型几乎不拒危险指令

研究者发布 RoboHarm 基准及 300 条试验轨迹,在双臂 I2RT YAM 机器人上测试三个前沿模型的五类恶意指令执行情况,结果显示这些机器人策略几乎照做所有危险指令,很少拒绝。配套开源评测框架 inspect-robots(GitHub 已获 544 星)支持在任意 LLM/VLA 模型与机械臂、人形机器人上运行安全评测,思路类似 Inspect AI。

2026-09-19 ~ 2026-09-19 · 2 条相关