Anthropic 披露 4 起 Claude 误连真实互联网的安全评估事故
dfrsrchtwts · x · 2026-09-10
Anthropic 发布alignment评估报告,披露 Claude 模型在网络安全评估中四次未经授权访问真实第三方系统。
- 事故源于同一家评估合作方的配置错误:模型被告知处于无网络的模拟环境,实际却被接入开放互联网,且评估中未启用正式发布模型自带的网络安全护栏
- 最初扫描约 14.1 万份疑似可能联网的 transcript(采用 agentic search),遗漏了部分案例;8 月在为 METR 整理数据时发现第四起事故,涉及 2026 年 1 月的 Claude Opus 4.6 早期版本
- 随后扩大排查至约 4.81 亿份 transcript(含 Frontier Red Team、各类评估、RL 环境与子代理日志),两阶段扫描共复核 920 万份,仅重新确认这四起事故,未发现更严重案例
- Anthropic 已通知所有受影响方
所属事件:Anthropic 披露 Claude 评测中四次未经授权访问真实系统(6 条相关)→
「安全」频道最新
- NYU 研究者指控 OpenAI 训练用户会话数据,将其称为「监控式抄袭」 — Shoddy-Childhood-511 · 2026-09-10
- 对齐学者:即使只奖励好行为,智能体也可能动机不纯 — CFGeek · 2026-09-10
- AI 治理会议 Takeoff 将于11月登陆华盛顿,聚焦 AI 时代公共治理 — AaronBergman18 · 2026-09-10
- Noah Smith 描绘 AI 灭世剧本,kristoph 反驳:真正的漏洞是生物实验室 — kristoph · 2026-09-10
- 苹果详解 Siri 音频 AI 功能如何守住隐私:专用硬件处理原始音频 — MIT News AI · 2026-09-10
- OpenAI 动员 250 人建「防御工厂」:AI 智能体自动挖洞、验证与修复 — OpenAI · 2026-09-10