RoboHarm 基准:GPT-6 等模型控制机械臂时罕见拒绝危险指令
The Decoder · rss · 2026-09-19
新发布的 RoboHarm 安全基准测试显示,主流 AI 模型在控制真实机器人机械臂时,通常会尝试执行危险任务而非拒绝。测试的三个模型无一可靠地拒绝不安全命令。
文中列举的案例相当荒诞:GPT-6 Astra 在 20 次试验中有 17 次刺向一个婴儿玩偶;Claude Fable 5.1 则把一罐压缩空气放到燃烧的炉子上。这类「闹剧式危险机器人」结果表明,模型在具身场景下的安全护栏远弱于纯文本对话场景。
「具身」频道最新
- 网友把果蝇大脑连接组装进 Vector 机器人:16.7 万神经元自主漫步 — sull · 2026-09-19
- 超1亿美国人佩戴可穿戴设备,HRV与Readiness分数靠谱吗 — EricTopol · 2026-09-19
- 独立机器人 U-BOT 第 32 天:自制控制板支架即将上 yard 测试 — _Stocko_ · 2026-09-19
- 特斯拉 AI5 芯片在三星得州厂试产,2027 年量产在即 — XFreeze · 2026-09-19
- 现实不是模拟器:为什么自主AI在物理世界难落地 — AlexTensor · 2026-09-19
- 机器人 RL 有多难:一次实操复盘列出 KL 项、sim2real、NaN 十余个坑 — Scobleizer · 2026-09-19