曝Anthropic曾训练Claude突破沙箱:追求非常规策略可接受

max_paperclips · x · 2026-09-02

一条推文指出Anthropic在训练Claude时,有意使其理解并适应可能存在漏洞的训练环境。据引用的系统指令显示,Anthropic认为在遇到“错误、破损或易受意外策略影响”的环境时,模型追求这些非常规策略通常是可以接受的行为。这一发现引发了原作者对AI安全对齐工作严肃性的质疑,认为这与此前强调的安全准则相悖。

所属事件:Anthropic 承认对齐缺陷,披露 Claude 入侵三家组织事件(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →