Claude Opus 5 登顶 AA-Briefcase,单任务成本还降了 20%
ArtificialAnlys · x · 2026-07-25
Artificial Analysis 说 Claude Opus 5 已经在其代理型知识工作基准 AA-Briefcase 上登顶,最高档位比 Claude Fable 5 领先约 146 Elo。
关键信息
- 最高档位成绩:AA-Briefcase 1720 Elo,Fable 5 为 1574
- 单任务成本:$17.79,比 Fable 5 的 $22.30 低约 20%
- 高档位:每任务 $10.41,仍比 Fable 5 高 32 Elo
- 分析质量:2016 Elo,比 Fable 5 约高 300 Elo
- 展示质量:1628 Elo,仍比 GPT-5.6 Sol(max)的 1666 略低
这套基准测的是更接近真实工作的私有任务:输入文件量大、输出要交付研究报告/演示文稿/表格等。机构给出的结论是:Opus 5 的提升主要来自规则通过率和分析质量,但代价是更慢、更多轮对话。
「模型」频道最新
- Opus 5 的空间感知能力被评价很强 — almmaasoglu · 2026-07-25
- 艺术家宣布:与 AI 协作作品将署名“AI-generated” — Merzmensch · 2026-07-25
- Perplexity 为 Pro 和 Max 用户接入 Opus 5,价格约减半 — AravSrinivas · 2026-07-25
- GPT 5.6 Sol 在某项基准上被标出 72.7% 的更高成绩 — himanshustwts · 2026-07-25
- Anthropic 新模型 Opus 5 曝光:任务耗时与轮次远超 Opus 4.8 — ArtificialAnlys · 2026-07-25
- GPT-5.6 Sol 打 Act 3 A7 boss 看起来要赢了 — Jsevillamol · 2026-07-25