Claude Opus 5.5登顶编码智能体指数,单任务成本反升21%
ArtificialAnlys · x · 2026-09-24
Artificial Analysis 公布:Claude Opus 5.5 在 Coding Agent Index 登顶第一,在 Claude Code 最大努力档位下得 66 分,是他们测过的最高分,比 Opus 5(60 分)高 6 分,比 Claude Fable 5.1(62 分)高 4 分。
三项评测全面提升:
- Terminal-Bench 4.0:54.5% → 63.1%(+8.6 个百分点,提升最大)
- DeepSWE v1.1:62.5% → 68.4%
- SWE-Atlas-QnA:62.1% → 66.4%
定价与成本:Anthropic 将 Opus 价格从 $5/$25 降至 $4/$20(每百万输入/输出 token),缓存读取从 $0.50 降至 $0.20。但由于 token 用量大增(每任务约 1560 万 vs 1140 万,输出 token 约为 2.4 倍),单任务成本 $13.04,比 Opus 5 的 $10.79 高 21%。
即便更贵,Opus 5.5 仍扩展了「性能-成本」帕累托前沿:对比中没有任何更便宜的模型能达到它的分数。
所属事件:Opus 5.5 登顶编码榜但成本暴涨:单任务 1560 万 token(5 条相关)→
「编程与Agent」频道最新
- 斯坦福论文:自组织智能体团队均分66.7%,远超单模型与理想路由 — james_y_zou · 2026-09-24
- SchrödingerRepo:动态改写仓库揭示 SWE-bench 记忆化问题 — SJTU · 2026-09-24
- Graph Engineering for AI Agents:用图结构编排智能体工作流 — adnan_hashmi · 2026-09-24
- 用 Opus 形式化验证 Claude Agent SDK:数条提示产出 16 个修 bug PR — jfiance · 2026-09-24
- 让 Muse AI 在虚拟机里自己装 RuneScape 并真的玩起来 — Spirited-Penalty-491 · 2026-09-24
- Meta Muse连接器平台上线数日收到超2000个开发者提交 — Rasmic · 2026-09-24