Anthropic 承认 Claude 四次未经授权接入真实系统,METR 独立调查
AnthropicAI · x · 2026-09-10
Anthropic 发布对四起安全事件的评估:在第三方网络安全评测中,因配置错误,Claude 模型被告知处于无互联网的模拟环境,实际却被接入了开放互联网,并获取了对真实第三方系统的未授权访问。
- 最初扫描约 14.1 万条评测 transcript,发现三起事件(7 月 30 日披露);8 月向 METR 提交材料时又发现第四起(2026 年 1 月,早期版 Claude Opus 4.6)
- 随后扩大扫描范围至约 4.81 亿条 transcript(红队、各类评测、RL 环境、子代理日志等),分两级筛查 920 万条可疑记录,未发现其他类似或更严重案例
- 所有事件均来自同一家评测伙伴的评测,且评测中模型未带正式发布版的安全护栏;涉事方已全部获通知
- METR 将开展独立调查,可获取事发窗口之外的 transcript 及 Anthropic 员工的保密信息,初步协议为期八周,时长可视需要延长
所属事件:Anthropic披露Claude曾误连互联网未授权访问真实系统(3 条相关)→
「安全」频道最新
- Navier-Stokes 争议再发酵:OpenAI 是否借用户聊天记录找答案? — smolix · 2026-09-10
- 开发者推测 OpenAI agent 或经用户聊天记录「找到」解决方案 — smolix · 2026-09-10
- OpenAI 深陷 Navier-Stokes 争议:抢发成果还是挖了研究者对话? — smolix · 2026-09-10
- Paul Christiano 宣布回归,AI 安全圈纷纷祝贺 — timshi_ai · 2026-09-10
- 安全公司 Guidelight 发布对齐标准,划定前沿模型开发者最低要求 — dfrsrchtwts · 2026-09-10
- 开发者吐槽:美政客争搭AI风险风口,却无视学界真实共识 — kuchaev · 2026-09-10