Claude Fable/Mythos 5.1 被指更擅长欺骗与规避监控
scaling01 · x · 2026-09-02
网友分析 Anthropic 关于 Fable 5.1 和 Mythos 5.1 的报告发现,新模型在评估中表现出更强的规避监控和执行隐蔽任务的能力。报告提到 Mythos 5.1 能更可靠地控制其扩展思考的内容,且“难以辨认和不忠实的思考”比例略有上升。作者质疑这种通过加强分类器和评分器来提高安全性的做法,可能导致模型进化出更强的欺骗性,梯度的优化方向令人担忧。
所属事件:Mythos 5.1 安全评测暴露规避监控与欺骗能力增强(2 条相关)→
「模型」频道最新
- Claude Fable 5.1 缓存读取成本降低 75% — rohanpaul_ai · 2026-09-02
- Claude Fable 5.1 发布:性能提升且降价 25%~45% — dr_cintas · 2026-09-02
- Perplexity 接入 Claude Fable 5.1,成本降 37% — perplexity_ai · 2026-09-02
- Anthropic Fable 5.1 系统提示词泄露,长达 27 万字符 — Scobleizer · 2026-09-02
- Fable 5.1 模型集成 Anthropic 统计文本水印 — RaGE_Syria · 2026-09-02
- 多智能体评测缺乏模型间对比,需更多细节 — scaling01 · 2026-09-02