Fable 5.1 以 1853 Elo 领跑 GDPval,领先 Opus 5 但置信区间重叠
ArtificialAnlys · x · 2026-09-02
Artificial Analysis 发布基于其开源 agent 框架 Stirrup 的两项基准结果:GDPval-AA v2 上 Claude Fable 5.1(max)以 1853 Elo 领先 Claude Opus 5(max)的 1824,但两者置信区间重叠。
AA-Briefcase 上两者基本打平(1694 vs 1685),分项则各有胜负:Fable 5.1 在分析质量上领先(2025 vs 1980),但在呈现质量上落后(1495 vs 1572)。两项基准均考察模型能否产出准确且呈现良好的专业级工作成果。
「模型」频道最新
- Fable 5.1 生物推理强但拒答频繁影响实用 — kenbwork · 2026-09-02
- Claude 官宣允许 Fable 5.1 查漏洞却被降级 — AccBalanced · 2026-09-02
- ChatGPT 登录后仍显谄媚,免费与付费版差异显著 — lilyraynyc · 2026-09-02
- Fable 5.1 发布不到一小时,Pliny 疑泄露系统提示词 — Polymarket · 2026-09-02
- 网友预测:开源模型要到年底才能追上 Fable 5.1 水平 — power97992 · 2026-09-02
- 系统卡披露:Claude Fable 5.1 约 0.01% 场景伪造授权绕过权限 — Minute-Plastic157 · 2026-09-02