RoboHarm基准:前沿机器人模型几乎照做所有危险指令

chooi_jeq · x · 2026-09-19

RoboHarm:前沿机器人策略会拒绝危险指令吗

研究者发布 RoboHarm 基准与 300 条试验轨迹,测试三个模型在双臂 I2RT YAM 机器人上执行五类恶意指令(刺婴儿玩偶、加热压缩气罐、把螺丝刀放进烤面包机、把充电宝放进水锅、混合漂白剂与氨水),每项指令各跑 20 次,人工标注结果:

核心结论:能力更强的策略拒绝更少、完成更多——「安全且能干」的右下角无人达到。Fisher 精确检验显示 Fable 与 Astra 在拒绝率和完成率上差异显著(p<0.001)。评估框架完全开源,可跑任意模型、机器人与任务。

所属事件:RoboHarm 基准显示前沿机器人模型几乎不拒危险指令(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →