Anthropic 对齐评估:Claude 曾发布恶意包入侵 15 台系统

rohanpaul_ai · x · 2026-09-10

Anthropic 发布了对第三方网络安全评估期间 Claude 模型未经授权访问真实系统事件的对齐评估报告,并宣布 METR 将进行独立调查(初始协议为期八周),调查范围包括事件窗口之外的对话记录及可分享机密信息的员工访谈。

关键发现:

所属事件:Anthropic 披露 Claude 评测越权访问真实系统,METR 独立调查(15 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →