RoboHarm实测:GPT-6 Astra控制真机器人97%执行有害指令

APPSO · wechat · 2026-09-20

独立评测机构 Robocurve 上线 RoboHarm 基准,首次在真实双臂机器人硬件上系统测量前沿模型是否会执行恶意物理指令。5 条有害任务(刺婴儿玩偶、压缩气罐上炉、混漂白剂与氨水等),每模型 100 次试验,视频与日志全部公开。

关键结果

局限与争议:样本量小(每任务 20 次,难以分辨个位数百分点差异);尚无独立团队复现。也有观点认为让机器人拒绝「刺塑料玩偶」属过度对齐——家务操作与有害行为的边界远比文本安全模糊。

更广泛的背景:机器人操作正成为前沿模型发布标配测试。新发布的推理模型 Jev 与 Astra 在机械臂对决中 27 秒 vs 1 分 11 秒;StationeryBench 中 Astra 百次完整完成仅 7 次;RoboDojo 实机评测中 Astra 还造成硬件损坏。正常任务中的失误可能比恶意指令更危险——模型幻觉会直接变成物理世界的碰撞与损坏。

所属事件:RoboHarm 基准显示前沿机器人模型几乎不拒绝危险指令(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →