Claude Fable 5.1 发布:科研基准翻倍,解数据留存
dotey · x · 2026-09-02
Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,两者为同一模型但安全限制不同。Fable 5.1 面向大众,Mythos 5.1 仅面向特定研究人员。
核心升级:
- 科研能力:在 Terminal-Bench-Science 0.1 上得分 52.6%(前代 24.7%),实现翻倍。
- 编程能力:Terminal-Bench 4.0 得分 55.8%(Mythos 版 60.9%),超越 Opus 5。
- 自动化:AutomationBench 得分从 17.1% 提升至 31.4%。
- 企业数据:提供数据留存争议的解决方案(零数据保留)。
- 成本:价格下降(具体见评测)。
实战案例:投资公司 Millennium 用 Fable 5.1 找到了困扰工程师数年的系统崩溃根因。
所属事件:Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存降价 75%(174 条相关)→
「模型」频道最新
- 自称第三方产品 Scry 在 DeepSearchQA 上以 71.8% 胜 Gemini 的 66.1% — AaronBergman18 · 2026-09-06
- 曝 OpenAI 内测下一代 GPT-6 Sol,Astra 发布数周后再上新 — koltregaskes · 2026-09-06
- 「SVG、Web 开发、办公全被解决」:开发者呼吁急需新基准测试 — flavioAd · 2026-09-06
- 美模型安全护栏太紧,Hugging Face 网络防御被迫转向中国模型 — victor_explore · 2026-09-06
- 开发者吐槽 OpenAI Astra 编码爱加多余注释,与旧版 ChatGPT 风格不同 — cnakazawa · 2026-09-06
- GPT Astra 一句话生成 SDF 3D 场景,质疑者称靠蛮力不泛化 — teortaxesTex · 2026-09-06