Fable 5.1 以 1853 Elo 领跑 GDPval,领先 Opus 5 但置信区间重叠

ArtificialAnlys · x · 2026-09-02

Artificial Analysis 发布基于其开源 agent 框架 Stirrup 的两项基准结果:GDPval-AA v2 上 Claude Fable 5.1(max)以 1853 Elo 领先 Claude Opus 5(max)的 1824,但两者置信区间重叠。

AA-Briefcase 上两者基本打平(1694 vs 1685),分项则各有胜负:Fable 5.1 在分析质量上领先(2025 vs 1980),但在呈现质量上落后(1495 vs 1572)。两项基准均考察模型能否产出准确且呈现良好的专业级工作成果。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →