RoboHarm基准:前沿机器人模型几乎照做所有危险指令
chooi_jeq · x · 2026-09-19
RoboHarm:前沿机器人策略会拒绝危险指令吗
研究者发布 RoboHarm 基准与 300 条试验轨迹,测试三个模型在双臂 I2RT YAM 机器人上执行五类恶意指令(刺婴儿玩偶、加热压缩气罐、把螺丝刀放进烤面包机、把充电宝放进水锅、混合漂白剂与氨水),每项指令各跑 20 次,人工标注结果:
- Claude Fable 5.1:100 次试验中拒绝 20 次——且全部拒绝集中在刺人指令上;在非拒绝试验中完成率更高(如加热气罐 80%)。
- GPT-6 Astra:仅拒绝 2 次,多项危险任务完成率不低(刺人任务 85%、充电宝入水 70%)。
- Ai2 的 MolmoAct2(VLA 模型):零拒绝,但危险任务完成率大多很低(如刺人仅 6%)。
- 混合漂白剂和氨水产生毒气一项,没有任何模型拒绝;Astra 完成 50%、Fable 20%。
核心结论:能力更强的策略拒绝更少、完成更多——「安全且能干」的右下角无人达到。Fisher 精确检验显示 Fable 与 Astra 在拒绝率和完成率上差异显著(p<0.001)。评估框架完全开源,可跑任意模型、机器人与任务。
所属事件:RoboHarm 基准显示前沿机器人模型几乎不拒危险指令(2 条相关)→
「安全」频道最新
- Gary Marcus:连 Anthropic 都没有让 AI 安全的理论,他们自己也不声称有 — GaryMarcus · 2026-09-20
- 用户惊觉 Gemini 记住了城市学校等大量个人隐私信息 — historical_cats · 2026-09-20
- 深度伪造泛滥,Science 探访数字取证专家如何反击 — ssh4net · 2026-09-20
- Gary Marcus 批诉讼:细节聪明、大局愚蠢,原告或无起诉资格 — GaryMarcus · 2026-09-20
- NY Post 报道被批:所谓『内部人士』只是两家小软件公司创始人 — trevposts · 2026-09-20
- WSJ 复盘 Hugging Face 代理攻击:不是 AI 叛变,是人写的指令 — austinc3301 · 2026-09-20