Claude 新模型基准测试曝光:TBS 科学分 52.6%
eyishazyer · x · 2026-09-02
引用推文展示了一款新模型(可能是 Claude)的基准测试成绩。该模型在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5 的两倍多;在 Terminal-Bench 4.0 上得分 55.8%,而 Fable 5 为 42.0%。
所属事件:Claude Fable 5.1 跑分曝光 多项基准碾压对手(2 条相关)→
「模型」频道最新
- Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1 — rudrank · 2026-09-02
- Meta 重返 AI 第一梯队,Zuckerberg 野心藏于财报 — rohanpaul_ai · 2026-09-02
- Claude Fable 5.1 发布,Terminal Bench 科学评分惊人 — TheZachMueller · 2026-09-02
- Fable 5.1 运行 AAII 任务耗币激增 73.5% — Angaisb_ · 2026-09-02
- Fable 5.1 实测:最强编码模型,token 消耗仅 Opus 5 一半 — every · 2026-09-02
- Fable 5.1 实际提升远超 Artificial Analysis 榜单显示 — cedric_chee · 2026-09-02