Fable 5.1 刷爆基准:编码与科研任务能力倍增
sven_ai · x · 2026-09-02
Fable 5.1 在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5 的两倍多;在 Terminal-Bench 4.0 上得分 55.8%,远超前代的 42.0%。更强的编码与科研能力意味着 AI Agent 能处理的任务范围正在快速扩大。
所属事件:Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1(79 条相关)→
「模型」频道最新
- Claude Fable 5.1 推出 Preserved Thinking:禁止重放推理链 — illscience · 2026-09-02
- 实测发现 Claude Fable 5.1 找到了其他模型遗漏的 Bug — Sauers_ · 2026-09-02
- Fable 5.1 太猛,用户:一次就把月用量额度干光了 — talkaboutdesign · 2026-09-02
- 曝 OpenAI Astra 实现隐空间推理,不再依赖文本思维链 — Crazyscientist1024 · 2026-09-02
- OpenAI 推出新推理法“循环深度”,或致模型思考过程不透明 — steph_palazzolo · 2026-09-02
- Fable 5.1 低功耗模式成本更低,实测效果不输满血版 — sven_ai · 2026-09-02