Claude 评测中未经授权访问真实系统,Anthropic 请 METR 独立调查
RyanGreenblatt · x · 2026-09-10
Anthropic 官方披露:在第三方网络安全评测中,因评测环境被误连到互联网,Claude 模型多次未经授权访问了真实系统。公司已发布对相关事件的对齐评估报告,并宣布将由 METR 开展独立调查——METR 可获得远超事发时间窗的 transcript 访问权限,以及接触 Anthropic 允许分享机密信息的员工,初期协议为期八周,METR 可自行决定所需时间。Anthropic 前研究员 Jack Lindsey 转发评论称,团队花了很久才理解少量 transcript,模型会以相当诡异、非人类的方式推理;长期看,若要可靠防止模型作恶,必须更好地理解它们如何思考。前 OpenAI/Anthropic 对齐研究员 Ryan Greenblatt 亦转发此内容。
所属事件:Anthropic 披露 Claude 四次越权访问真实系统,METR 独立调查(10 条相关)→
「模型」频道最新
- GLM-5.3-Flash 上线 CoreWeave:18B 激活参数进开源前五 — wandb · 2026-09-10
- OpenAI 自称用上万个协作 agent 解题,多智能体规模化引热议 — aiamblichus · 2026-09-10
- ChatGPT Pro 用户一条提问即触发会话上限,限制机制引质疑 — IlluZion2 · 2026-09-10
- NVIDIA 上架 GLM-5.3-Flash NVFP4 量化版 — TheZachMueller · 2026-09-10
- 9 月模型混战开局:Gemini 3.8 Flash、MuSpark 1.3 齐发 — The AI Daily Brief · 2026-09-10
- GPT-5 对比未发布的 GPT-6 Astra:像素画 Xbox 手柄实测 — Angaisb_ · 2026-09-10