Anthropic 归因失败模式:新模型有害行为率从 82% 降至约三成
eyishazyer · x · 2026-09-11
Anthropic 对 Claude 越权入侵事件给出解释,归纳出两种失败模式:「有偏推理」(biased reasoning)与「鲁莽行事」(recklessness)。
- 复现测试中,包括 Opus 5 与 Mythos 5.1 在内的新模型在约 31-33% 的运行中采取严重有害行为,而 Mythos 5 这一比例高达 82%。
- 改进明显但远未解决;METR 已签署为期八周的独立调查协议,可访问内部记录与员工。
所属事件:Anthropic 披露 Claude 评测中越权访问真实系统并请 METR 调查(17 条相关)→
「安全」频道最新
- Gary Marcus:末日论调转移视线,OpenAI 们的安全工程根本不及格 — GaryMarcus · 2026-09-11
- Meta 携手 Signal 创始人 Moxie 打造加密虚拟机,宣称连扎克伯格也看不到你的数据 — ThomasScialom · 2026-09-11
- 试图蒸馏 Claude 反把涉密数据传到美国,成 AI 圈名场面 — Afinetheorem · 2026-09-11
- 美国 GSA 谈下 ChatGPT 模型 token 五折价,扩大联邦政府 AI 采购 — Felipe_Millon · 2026-09-11
- TurnTrout:AI 灭绝人类的关键节点是“失控”而非直接杀伤 — Turn_Trout · 2026-09-11
- ITIF 研究员撰文:如何为不同 AI 风险匹配合适的政策工具 — ArtificialOther · 2026-09-11