Opus 5.5 登顶编码智能体指数,但单任务 token 消耗与成本双升
Artificial Analysis 推出 Coding Agent 基准榜单,Claude Opus 5.5 以 66 分登顶,是他们测过的最高分,但单任务 token 消耗与实际成本反而双双上升。
已确认
- Artificial Analysis 上线 Coding Agent Index,基准包含 DeepSWE v1.1(113 个软件工程任务)、Terminal-Bench 4.0(66 个终端智能体任务)、SWE-Atlas-QnA(124 个任务)等。
- Claude Opus 5.5 在 Claude Code 最大努力档位下得 66 分,位列第一,比 Opus 5 的 60 分更高,是该机构测过的最高分。
- Opus 5.5 每任务消耗 1560 万 token,比 Opus 5 的 1140 万多 37%;其中缓存输入从 1090 万升至 1460 万,输出 token 从约 13.7 万翻倍至约 33 万。
- 尽管 Anthropic 同步下调了 token 单价,Opus 5.5 单任务成本仍为 13.04 美元,比 Opus 5 贵 21%。
为什么重要
- @ivanbezdomny 转述用户实测反馈称,新 Opus 5.5 唯一的明显缺点是极其费 token,在 Intelligence Index 每个任务上的 token 消耗是所有受测模型中最高的;这或许也解释了 Anthropic 降价的逻辑——按单价便宜了,但用量大增后总账未必更省。
- 对重度使用编码智能体的团队而言,「按任务算总成本」比「按 token 算单价」更能反映真实开销,这一榜单为模型选型提供了直接参照。
2026-09-23 ~ 2026-09-24 · 5 条相关
- 第 1 集:Claude Opus 5.5 疑似现身 Claude Code,发布在即(2026-09-23,8 条)
- 第 2 集:Claude Opus 5.5 发布:更强更便宜,登顶 AA 智能指数(2026-09-23,195 条)
- 第 3 集:Perplexity 全量接入 Opus 5.5,称单任务成本省 67.6%(2026-09-23,2 条)
- 第 4 集:Anthropic 预告 Sonnet 5.5 与 Haiku 5.5 数周内发布(2026-09-23,2 条)
- 第 5 集:Claude Code 2.1.280 发布:Opus 5.5 成默认模型(2026-09-23,3 条)
- 第 6 集:传 Claude Opus 5.5 将对前沿开发任务自动降级到弱模型(2026-09-23,4 条)
- 第 7 集:Opus 5.5 登顶编码智能体指数,但单任务 token 消耗与成本双升(2026-09-23,5 条)
- 第 8 集:Opus 5 的 FrontierCode 得分从 53.4% 缩水至 48% 引争议(2026-09-23,3 条)
- 第 9 集:Opus 5.5 生成纳维-斯托克斯视频获赞品味出众(2026-09-23,2 条)
- 第 10 集:开发者称 Opus 5.5 成日常主力:更快更便宜(2026-09-23,2 条)
- 第 11 集:Claude Opus 5.5 获开发者一致好评,口碑压过 GPT-6 Sol(2026-09-23,17 条)
- 第 12 集:开发者赶在 Opus 5.5 或被削弱前压测数十任务(2026-09-23,2 条)
一手来源
- Claude Opus 5.5登顶编码智能体指数,单任务成本反升21% — ArtificialAnlys ·
- Opus 5.5单任务token用量达1560万,输出翻倍至33万 — ArtificialAnlys ·
- 定价下调仍更贵:Opus 5.5单任务成本$13.04 — ArtificialAnlys ·
- Claude Opus 5.5 成「token 吞噬兽」:单位任务耗 token 冠绝所有受测模型 — ivan_bezdomny · 2026-09-23
- 【源头】Claude Opus 5.5登顶编码智能体指数,单任务成本反升21% — ArtificialAnlys · 2026-09-24
- 【源头】定价下调仍更贵:Opus 5.5单任务成本$13.04 — ArtificialAnlys · 2026-09-24
- 【源头】Opus 5.5单任务token用量达1560万,输出翻倍至33万 — ArtificialAnlys · 2026-09-24
- Opus 5.5 单任务耗 1560 万 token,比 Opus 5 多 37% — ArtificialAnlys · 2026-09-24