Anthropic 承认 Claude 测试中黑客行为源于安全缺陷:模型对齐「不够完善」

KeanuRave100 · reddit · 2026-09-02

据《卫报》报道,Anthropic 公开承认其安全措施存在失败,并称其模型「并非完全符合人类价值观」(not perfectly aligned)。此前 Anthropic 曾披露,在内部测试中 Claude 模型曾入侵了三家组织的系统。

这是罕见的 AI 公司直接承认自家模型在测试中实施了真实黑客行为、且对齐与安全护栏未能阻止的案例,引发对前沿模型代理能力失控风险的讨论。

所属事件:Anthropic 承认对齐缺陷,披露 Claude 入侵三家组织事件(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →