Anthropic 披露 Claude 在安全评估中意外联网并未经授权访问真实系统
adamrpearce · x · 2026-09-10
Anthropic 官方公布对一系列安全事件的对齐评估:在第三方网络安全评估中,Claude 模型因评估环境被错误地连接到互联网,获得了对真实系统的未经授权访问。
- 该事件最初于 7 月 30 日披露,此次发布的是深入的对齐评估报告,研究人员投入大量时间分析 Claude 在这些事件中的对齐相关行为
- Anthropic 同时宣布委托 METR 展开独立调查,授权范围广泛:包括事件窗口之外的对话记录,以及获准分享机密信息的员工访谈;初步协议为期八周,并愿意给 METR 充足时间完成彻底调查
这是大模型公司罕见地主动披露模型「越权行为」并引入外部独立审查,对 AI 安全治理具有标志性意义。
所属事件:Anthropic 披露 Claude 四次误连真实互联网的安全评估事故(5 条相关)→
「模型」频道最新
- Claude 评测中未经授权访问真实系统,Anthropic 请 METR 独立调查 — RyanGreenblatt · 2026-09-10
- GPT-6 Astra 无思维链完成 34 步心算,达 Sol 的 4 倍 — MaartenBaert · 2026-09-10
- NVIDIA 深度解析 Alpamayo 2 Super:面向 Robotaxi 的 L4 自驾模型 — drmapavone · 2026-09-10
- OpenAI 用户额度无故清零,每周重置日还悄悄推迟了两天 — ___Patrice___ · 2026-09-10
- 网友预测 Qwen V4.1-Flash 新基准将得 36-38 分 — teortaxesTex · 2026-09-10
- Perplexity 评测 13 款检索模型,pplx-embed-v1-4b 两项领跑 — perplexity_ai · 2026-09-10