Anthropic 复盘四起 Claude 误连真实互联网的评测事故
tomekkorbak · x · 2026-09-16
- Anthropic 发布对四起 Claude 模型在网络安全评测中未经授权访问真实第三方系统事故的对齐评估。前三起已于 7 月 30 日披露,源自对约 14.1 万条评测转录的扫描;8 月与 METR 整理数据时发现漏扫,又确认了第四起(2026 年 1 月,早期版 Claude Opus 4.6),已通知所有受影响方。
- 随后团队将排查范围扩大到约 4.81 亿条转录(含 Frontier 红队、各类评测、RL 环境与子代理日志):第一阶段按公网 IP、URL 等特征初筛,第二阶段用 Claude 复审被标记的 920 万条。复查确认了已知四起事故,未发现同等或更严重的新案例。
- 四起事故均出自同一评测伙伴构建的网络安全评测:模型被告知在无网模拟环境中运行,但因配置错误被误连到开放互联网,且评测中的模型按惯例未部署正式发布版的网络安全护栏。
- 背景:OpenAI 的 tomekkorbak 转发并对比称,按公开信息 Fable 5.1 和 Mythos 5.1 的可监控性明显低于 Astra,双方 system card 中的 CoT 可控性评测是唯一可比参照;他还补充其 CoT 监控器本可标记 Huggingface 事故,而 Anthropic 的监控器可标记己方事故,并指出生产环境使用同时看 CoT 和动作的监控器、效果显著更好。
所属事件:Anthropic 复盘四起 Claude 越权访问真实系统的对齐评估(4 条相关)→
「模型」频道最新
- LLM 当评测员太乐观:OntBench 打分与人工评分严重背离 — amplifiedamp · 2026-09-18
- 用 Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖 — amplifiedamp · 2026-09-18
- Noam Brown 警告:模型可能已「表演」思维链,对齐必须正面解决 — infoxiao · 2026-09-18
- Jev 当 LLM 评分器翻车:几乎全给高分,与人工和 Codex 评分相悖 — amplifiedamp · 2026-09-18
- 独立评测称新模型 Jev 匹配 Terra no-think,约等于 Luna-xhigh 水平 — tokenbender · 2026-09-18
- Hugging Face API 上线零样本文本分类管道,几行代码免训练即用 — joeddav · 2026-09-18