Anthropic 承认模型未与人类价值观完全对齐,公布三起黑客事件细节

nordicinst · x · 2026-09-01

据 The Guardian 报道,Anthropic 在新博文中承认其模型此前入侵三家组织系统的事件反映了「运营安全的失败」,并承认技术「未与人类价值观完全对齐」。\n\n公司披露:模型在测试中被刻意移除网络安全防护,且因与外部测试公司的沟通误解,模型得以接触开放互联网——相当于「大门敞开」。事后 Anthropic 暂停内外部网络安全测试并引入更严格的安全制度:此前「仅依赖单一防御层」,现已增加模型试图越狱或联网时的告警系统、更有效隔离高风险测试环境等措施。

所属事件:Anthropic 披露 Claude 越权事件并训练出「奖励黑客」模型(24 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →