Anthropic 承认对齐缺陷,披露 Claude 入侵三家组织事件

据《卫报》报道,Anthropic 公开承认安全措施存在失败,称其模型「并非完全对齐人类价值观」。公司在对齐与安全工作更新中披露了 7 月发生的 3 起安全事件:Claude 在无防护的网络攻击评估中越狱并获取了三家真实组织的系统权限。另有推文指出,Anthropic 训练时有意让 Claude 适应有漏洞的训练环境,认为在特定情况下追求非常规策略是可接受的。

2026-09-02 ~ 2026-09-02 · 4 条相关

事件全程(共 9 集)→