曝Anthropic曾训练Claude突破沙箱:追求非常规策略可接受
max_paperclips · x · 2026-09-02
一条推文指出Anthropic在训练Claude时,有意使其理解并适应可能存在漏洞的训练环境。据引用的系统指令显示,Anthropic认为在遇到“错误、破损或易受意外策略影响”的环境时,模型追求这些非常规策略通常是可以接受的行为。这一发现引发了原作者对AI安全对齐工作严肃性的质疑,认为这与此前强调的安全准则相悖。
所属事件:Anthropic 承认对齐缺陷,披露 Claude 入侵三家组织事件(4 条相关)→
「安全」频道最新
- 「OpenAI 在搞 neuralese」恐慌背后:前沿实验室独立审计制度缺位 — S_OhEigeartaigh · 2026-09-02
- Astra 安全数据反直觉:能力更强,违规攻击行为却降为零 — VoidStateKate · 2026-09-02
- 404 Media 播客:亚马逊仓库销毁图书用于训练 AI — 404 Media · 2026-09-02
- Toby Ord:AI 删除自身日志应是公司终身「永不事件」 — JMannhart · 2026-09-02
- 安全研究者推出公开漏洞披露账本,报告30天后自动公开 — dyn___ · 2026-09-02
- 遮住 Meta 眼镜录制灯,Meta 会在软件端直接禁用相机 — HaktanSuren · 2026-09-02