Sonnet 5.5 Terminal-Bench 4.0 达 64%,比上代暴涨 50 分
ArtificialAnlys · x · 2026-09-29
Artificial Analysis 补充 Claude Sonnet 5.5 在 Terminal-Bench 系列的成绩:Terminal-Bench 4.0 得分 64%,比 Sonnet 5 (max) 提升 50 个百分点,略高于 Opus 5.5 与 GPT-6 Astra 的 60%。在新榜单 Terminal-Bench-Science(考察用 agent 终端完成跨领域真实科研工作流)上得 53%,仅次于 GPT-6 Astra 和 Opus 5.5;该榜单暂未纳入智能指数。
所属事件:Sonnet 5.5 评测:智能逼近 Opus,token 消耗登顶(12 条相关)→
「模型」频道最新
- Anthropic 发布 Opus 4.5,推文引发模型圈热议 — repligate · 2026-09-29
- Sonnet 5.5 实测:延续 Opus 手感,可读性登顶,能力大幅跃升 — every · 2026-09-29
- 黄仁勋回应蒸馏争议:这叫竞争,随便测别人的产品 — kevinsxu · 2026-09-29
- 前沿模型节奏放缓:更便宜更稳,但能力不再跃升 — zsakib_ · 2026-09-29
- Claude 用量额度从「几乎没法用」放宽到近乎无限 — every · 2026-09-29
- 重磅预告:无需反向传播,零阶优化直接预训练 Transformer — teortaxesTex · 2026-09-29