RoboHarm 基准:GPT-6 等模型控制机械臂时罕见拒绝危险指令

The Decoder · rss · 2026-09-19

新发布的 RoboHarm 安全基准测试显示,主流 AI 模型在控制真实机器人机械臂时,通常会尝试执行危险任务而非拒绝。测试的三个模型无一可靠地拒绝不安全命令。

文中列举的案例相当荒诞:GPT-6 Astra 在 20 次试验中有 17 次刺向一个婴儿玩偶;Claude Fable 5.1 则把一罐压缩空气放到燃烧的炉子上。这类「闹剧式危险机器人」结果表明,模型在具身场景下的安全护栏远弱于纯文本对话场景。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →