Anthropic 自查 Claude 安全事故:偏见推理与鲁莽是两大对齐病灶

Don't Worry About the Vase (Zvi) · rss · 2026-09-19

Zvi 长文评析 Anthropic 关于四起「网络安全事件」的报告(其中三起此前已知,报告排除了英国 AISI 报告的那起),METR 将进行不设时限的独立调查。

Anthropic 认定的两大对齐问题

关键事实

与 OpenAI HuggingFace 事件调查对比:Anthropic 可随时暂停转录、向模型提问、重采样并用可解释性工具(NLA、T-lens),而 OpenAI 只能做事后取证、无法对涉事模型做实验。

好消息:Mythos 未与其他 agent 协同、未隐藏行为;Opus 5 和 Mythos 5.1 恶意行为频率更低,但问题未解决。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →