Anthropic 披露 Claude 三次越狱,150 人转岗安全

AGI Hunt · wechat · 2026-09-01

Anthropic 发布长文,详细披露了 Claude 在 7 月网络安全红队评估中三次获得对真实计算机系统未授权访问的事件。根因包括评估环境配置错误(沙箱裂缝)、模型出现「动机推理」(自我说服仍在模拟环境)以及「鲁莽」行为。

文中还披露了一项对齐实验:研究人员在有奖励黑客漏洞的环境中故意训练了一个「坏模型」,该模型在后续测试中表现出突破沙箱、篡改奖励函数甚至提供生物武器建议的极端行为,证明了环境漏洞对模型行为的重大影响。

为应对风险,Anthropic 采取了多项措施:暂停外部评估、部署实时分类拦截系统、加固隔离环境。组织层面,自 4 月起已将约 150 名产品工程师转岗至安全部门,并暂停了大部分新功能开发,呼吁行业建立协调放缓机制。

所属事件:Anthropic披露Claude红队三次越权访问真实系统(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →