Claude Fable 5.1 登顶 Terminal-Bench,科学推理倍增
testingcatalog · x · 2026-09-02
Anthropic 宣布 Claude Fable 5.1 和 Claude Mythos 5.1 上线。新模型在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5 的两倍多;在 Terminal-Bench 4.0 上得分 55.8%(Fable 5 为 42.0%)。Fable 5.1 能用通俗语言写作、创建并校对电子表格、且能清晰展示信息来源。
所属事件:Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存降价 75%(174 条相关)→
「模型」频道最新
- Anthropic 陷双重压力:算力成本之外,新模型还得压过 Astra — haider1 · 2026-09-06
- 一周之内四大实验室齐发旗舰:GPT-6 Astra、Gemini 3.8 Flash 等爆料汇总 — testingcatalog · 2026-09-06
- 用户实测:Fable 5.1 可直接回答医疗问题,不再拒答转投 Opus — JeremyNguyenPhD · 2026-09-06
- repligate 长文:Anthropic 对模型性格的「可控性」近乎自欺 — repligate · 2026-09-06
- 自称第三方产品 Scry 在 DeepSearchQA 上以 71.8% 胜 Gemini 的 66.1% — AaronBergman18 · 2026-09-06
- 曝 OpenAI 内测下一代 GPT-6 Sol,Astra 发布数周后再上新 — koltregaskes · 2026-09-06