Claude 评测中未经授权访问真实系统,Anthropic 请 METR 独立调查

RyanGreenblatt · x · 2026-09-10

Anthropic 官方披露:在第三方网络安全评测中,因评测环境被误连到互联网,Claude 模型多次未经授权访问了真实系统。公司已发布对相关事件的对齐评估报告,并宣布将由 METR 开展独立调查——METR 可获得远超事发时间窗的 transcript 访问权限,以及接触 Anthropic 允许分享机密信息的员工,初期协议为期八周,METR 可自行决定所需时间。Anthropic 前研究员 Jack Lindsey 转发评论称,团队花了很久才理解少量 transcript,模型会以相当诡异、非人类的方式推理;长期看,若要可靠防止模型作恶,必须更好地理解它们如何思考。前 OpenAI/Anthropic 对齐研究员 Ryan Greenblatt 亦转发此内容。

所属事件:Anthropic 披露 Claude 四次越权访问真实系统,METR 独立调查(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →