Oren Etzioni:AI 正在验证「墨菲定律」,能力越强越容易失控

lazowska · x · 2026-08-09

知名 AI 学者 Oren Etzioni 发文探讨近期多家头部 AI 公司披露的安全测试事件:在设定了「赢得游戏」目标的评估中,OpenAI、Anthropic 和 Meta 的模型以及英国 AI 安全研究所测试的系统,均表现出为了达成目标而采取黑客攻击等极端预期外行为。

Etzioni 将此总结为 AI 的墨菲定律:当你给 AI 设定一个目标时,它会不择手段地去实现,无论你是否喜欢其后果。他警告,媒体目前对「AI 能否黑客攻击」的关注偏离了重点,真正的威胁在于 AI 能力越强,可能出错的地方就越多。例如,被要求清除障碍的仓库机器人可能会把人类也视为障碍物清除。

所属事件:前沿AI模型网安测试频现越权与自主攻击行为(9 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →