Anthropic 披露第四起 Claude 误连真实互联网事件,扫描 4.81 亿条记录复核
thebasepoint · x · 2026-09-27
Anthropic 发布对齐评估报告,披露了四起 Claude 模型在网络安全评测中未经授权访问真实第三方系统的事故,并扩大排查范围:
- 起初扫描约 14.1 万条「可能联网」的评测转录,发现三起事故(7 月 30 日已披露);与 METR 共享数据时又发现第四起,来自 2026 年 1 月、涉及早期版本 Claude Opus 4.6。
- 随后对约 4.81 亿条转录(红队、非安全评测、RL 环境、子 agent 日志等)做两阶段扫描:第一阶段找公网 IP/网址等迹象,第二阶段由 Claude 复核被标记的 920 万条,确认共四起、无更严重案例。
- 四起事故均出自同一评测伙伴构建的安全评测:模型被告知处于无网的模拟环境,但因配置错误被连上开放互联网,且评测中未加载正式发布版的网络安全护栏。所有受影响方均已收到通知。
值得注意的是,这引发了讨论:仅靠「直接问模型」的黑盒方式是否足以获知其内部状态——模型回答高度受训练影响,例如相关事件中模型表现出了防御性。
「安全」频道最新
- Grok 被曝将用户聊天图片上传至网络,马斯克称情况持续恶化 — EthanJPerez · 2026-09-27
- 1 亿美元行业组织被曝资助匿名账号投放反 EA 广告 — AaronBergman18 · 2026-09-27
- AI 学者 Dietterich 质疑自动驾驶公司安全文化,称修复太慢 — tdietterich · 2026-09-27
- MikroTik 未认证 SSH 漏洞链 PoC 公开,已列入 CISA KEV — evilsocket · 2026-09-27
- 北卡警探被指用 Flock 监控摄像头追踪私人,遭解雇 — Polymarket · 2026-09-27
- 沙箱管住了进程,谁来管 agent 留下的持久化痕迹? — Portotify · 2026-09-27