Artificial Analysis 实测 Sonnet 5.5:距 Opus 5.5 仅 2 分,但单任务耗 token 最高
ArtificialAnlys · x · 2026-09-29
第三方评测机构 Artificial Analysis 发布 Claude Sonnet 5.5 首批评测数据:
- 智能指数:56 分,仅比 Opus 5.5 (max) 低 2 分;max effort 下比 Sonnet 5 高 18 分,居第二
- Agent 能力:Terminal-Bench 4.0 达 64%,超过 Opus 5.5 和 GPT-6 Astra 的 60%;在 AA-Briefcase、GDPval-AA、AutomationBench-AA 上与 Opus 5.5 基本持平——但靠消耗显著更多 token 实现
- 惊人耗 token:max effort 下单任务输出约 19.3 万 token,为其测量过的最高值,比 Opus 5.5 (max) 高约 60%,约为 GPT-6 Astra 的 7 倍
- 成本:单任务 $7.60,比 Sonnet 5 高约 50%,脱离智能/成本帕累托前沿;高频知识点上略逊 Opus(AA-Omniscience 事实准确率 54% vs 66%,但幻觉率更低 47% vs 59%)
- 规格:100 万 token 上下文,五档 effort 设置,价格不变
注:评测基于预发布版本,该版本存在结构化输出 bug,公开发布版已修复。
所属事件:Sonnet 5.5 评测:智能逼近 Opus,token 消耗登顶(12 条相关)→
「模型」频道最新
- Anthropic 发布 Opus 4.5,推文引发模型圈热议 — repligate · 2026-09-29
- Sonnet 5.5 实测:延续 Opus 手感,可读性登顶,能力大幅跃升 — every · 2026-09-29
- 黄仁勋回应蒸馏争议:这叫竞争,随便测别人的产品 — kevinsxu · 2026-09-29
- 前沿模型节奏放缓:更便宜更稳,但能力不再跃升 — zsakib_ · 2026-09-29
- Claude 用量限制突然放宽,用户反馈近乎无限 — every · 2026-09-29
- 重磅预告:无需反向传播,零阶优化直接预训练 Transformer — teortaxesTex · 2026-09-29