AA 评测 Sonnet 5.5:性能逼近旗舰,token 消耗最高
Anthropic 发布 Claude Sonnet 5.5 后,第三方评测机构 Artificial Analysis(AA)随即公布首批评测:该模型在 AA 智能指数上得 56 分,仅比 Opus 5.5(max)低 2 分,性能逼近自家旗舰;但 max effort 下单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,高消耗带来的成本问题成为本批评测的核心争议。
已确认
- 智能指数 56 分,距 Opus 5.5(max)仅 2 分;AA 已公布各推理力度下智能指数单项评测完整明细。
- max effort 档单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,约为 GPT-6 Astra 的 7 倍;对比 Opus 5.5 max 的 11.9 万,远超同系模型。
- Terminal-Bench 4.0 得分 64%,较 Sonnet 5(max)提升 50 个百分点。
- AA 模型对比页显示该系列 5 个推理力度档位(max/xhigh/high/medium 及更低档)智能指数分别为 56/52/47/41 分等,五档单任务成本从 $0.41 到 $7.60,价差达 18 倍。
尚未确认
- AI 资讯博主 AiBreakfast 认为 Sonnet 5.5 的综合表现已排在 Opus 5.5 与 Fable 5.1 之上,但该观点仅为简短排序判断,未附具体测试数据。
为什么重要
- Sonnet 5.5 以中端定位逼近旗舰性能,体现 Anthropic 在推理力度分级上的策略,但高消耗意味着实际使用成本可能翻倍:@haider1 的成本核算称其为「token 吞金兽」,单任务成本约为 GPT-6 的 2 倍。
- 对按 token 计费的开发者而言,智能指数与单位成本需综合权衡,AA 的五档明细(单任务成本 $0.41 至 $7.60)为选型提供了直接参考。
2026-09-29 ~ 2026-09-29 · 8 条相关
- 第 1 集:传 Claude Sonnet 5.5 智能指数达 56 分(2026-09-29,3 条)
- 第 2 集:AA 评测 Sonnet 5.5:性能逼近旗舰,token 消耗最高(2026-09-29,8 条)
一手来源
- Artificial Analysis 实测 Sonnet 5.5:距 Opus 5.5 仅 2 分,但单任务耗 token 最高 — ArtificialAnlys ·
- AA 实测:Claude Sonnet 5.5 单任务烧 19.3 万输出 token,是 GPT-6 Astra 的 7 倍 — ArtificialAnlys ·
- Claude Sonnet 5.5 五档模型价差 18 倍:单任务成本 $0.41 到 $7.60 — ArtificialAnlys ·
- 【源头】Artificial Analysis 实测 Sonnet 5.5:距 Opus 5.5 仅 2 分,但单任务耗 token 最高 — ArtificialAnlys · 2026-09-29
- Sonnet 5.5 Terminal-Bench 4.0 达 64%,比上代暴涨 50 分 — ArtificialAnlys · 2026-09-29
- 【源头】AA 实测:Claude Sonnet 5.5 单任务烧 19.3 万输出 token,是 GPT-6 Astra 的 7 倍 — ArtificialAnlys · 2026-09-29
- Artificial Analysis 发布 Claude Sonnet 5.5 全评测明细与各档推理力度对比 — ArtificialAnlys · 2026-09-29
- 【源头】Claude Sonnet 5.5 五档模型价差 18 倍:单任务成本 $0.41 到 $7.60 — ArtificialAnlys · 2026-09-29
- Anthropic 发布 Claude Sonnet 5.5:评测得分距 Opus 5.5 仅 2 分 — jarrodwatts · 2026-09-29
- Sonnet 5.5 是 token 吞金兽:单任务 193k 输出,成本 2 倍于 GPT-6 — haider1 · 2026-09-29
- 博主点评:Sonnet 5.5 综合表现已超 Opus 5.5 与 Fable 5.1 — AiBreakfast · 2026-09-29