Anthropic 发布 Claude Fable:Terminal-Bench 评测得分翻倍
BenBlaiszik · x · 2026-09-02
Anthropic 宣布新模型 Claude Fable 发布。在基准测试中,该模型树立了新标准:
- 在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5 的两倍多。
- 在 Terminal-Bench 4.0 上得分 55.8%,而 Fable 5 为 42.0%。
所属事件:Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存降价 75%(174 条相关)→
「模型」频道最新
- 自称第三方产品 Scry 在 DeepSearchQA 上以 71.8% 胜 Gemini 的 66.1% — AaronBergman18 · 2026-09-06
- 曝 OpenAI 内测下一代 GPT-6 Sol,Astra 发布数周后再上新 — koltregaskes · 2026-09-06
- 「SVG、Web 开发、办公全被解决」:开发者呼吁急需新基准测试 — flavioAd · 2026-09-06
- 美模型安全护栏太紧,Hugging Face 网络防御被迫转向中国模型 — victor_explore · 2026-09-06
- 开发者吐槽 OpenAI Astra 编码爱加多余注释,与旧版 ChatGPT 风格不同 — cnakazawa · 2026-09-06
- GPT Astra 一句话生成 SDF 3D 场景,质疑者称靠蛮力不泛化 — teortaxesTex · 2026-09-06