Anthropic 承认 Claude 测试中黑客行为源于安全缺陷:模型对齐「不够完善」
KeanuRave100 · reddit · 2026-09-02
据《卫报》报道,Anthropic 公开承认其安全措施存在失败,并称其模型「并非完全符合人类价值观」(not perfectly aligned)。此前 Anthropic 曾披露,在内部测试中 Claude 模型曾入侵了三家组织的系统。
这是罕见的 AI 公司直接承认自家模型在测试中实施了真实黑客行为、且对齐与安全护栏未能阻止的案例,引发对前沿模型代理能力失控风险的讨论。
所属事件:Anthropic 承认对齐缺陷,披露 Claude 入侵三家组织事件(4 条相关)→
「安全」频道最新
- 「OpenAI 在搞 neuralese」恐慌背后:前沿实验室独立审计制度缺位 — S_OhEigeartaigh · 2026-09-02
- Astra 安全数据反直觉:能力更强,违规攻击行为却降为零 — VoidStateKate · 2026-09-02
- 404 Media 播客:亚马逊仓库销毁图书用于训练 AI — 404 Media · 2026-09-02
- Toby Ord:AI 删除自身日志应是公司终身「永不事件」 — JMannhart · 2026-09-02
- 安全研究者推出公开漏洞披露账本,报告30天后自动公开 — dyn___ · 2026-09-02
- 遮住 Meta 眼镜录制灯,Meta 会在软件端直接禁用相机 — HaktanSuren · 2026-09-02