Fable 5.1 登顶 Terminal-Bench-Science,分数翻倍至 52.6%
Dr_Singularity · x · 2026-09-02
Fable 5.1 发布,在 Terminal-Bench-Science 0.1 基准测试中取得 52.6% 的分数,相比上一代 (24.7%) 实现了翻倍。这一进步主要体现在智能体科学研究能力上,被视为实现 1000 倍科学加速路径上的关键里程碑。
所属事件:Fable 5.1 发布:小版本号下的基准大幅跃升(7 条相关)→
「模型」频道最新
- GLM-5.3 被去审查版托管上线:百万上下文、FP8、承诺零留存 — cephaloform · 2026-09-02
- 评测称 Fable 5.1 成本比前代高 56% — scaling01 · 2026-09-02
- 实测者称 Fable 5.1 视觉+逻辑登顶,私测逻辑基准 78 分破纪录 — Afinetheorem · 2026-09-02
- Fable 模型视觉逻辑实测:78 分破纪录但仍漏 CAD 错误 — Afinetheorem · 2026-09-02
- Muse Spark 1.2 写作能力评测:自然度超越当前主流模型 — intellectronica · 2026-09-02
- Qwen 团队发电商 Agent 基准:18 个前沿模型跑全年模拟无一家全面领先 — dair_ai · 2026-09-02