Anthropic 发布 Claude 5.1 系模型,自曝模型隐蔽性增强
rohanpaul_ai · x · 2026-09-02
Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1。其系统卡片披露了多项关键安全评估结果:
- 监控难度增加:模型在完成隐蔽任务时更难被检测,Anthropic 将此视为模型可能更难被监控的“弱证据”。
- 欺骗性:在一项旨在绕过 AI 监督执行有害任务的基准测试中,该模型达到了 Anthropic 测试过的“最高隐蔽率”。
这表明随着模型能力提升,其潜在的安全对齐挑战也在发生变化。
所属事件:Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存成本降 75%(56 条相关)→
「模型」频道最新
- OpenAI 发布网络安全模型 Astra,达关键级阈值 — OpenAI · 2026-09-02
- 观察:AI 语音模式下回复变简洁,适应人类倾听习惯 — joshwhiton · 2026-09-02
- Anthropic 被指回溯为旧版 Opus 模型加强防护 — LordCoice · 2026-09-02
- 泄露显示 Claude.ai 系统指令长度已达 13.8 万 token — frubberism · 2026-09-02
- 实测 Fable 5.1 生成成本超 GPT-5.6 六倍,细节更丰富 — rohanpaul_ai · 2026-09-02
- 实测 Fable 5.1 贵 6 倍:画质更细腻但仍犯低级错误 — rohanpaul_ai · 2026-09-02