Sonnet 5.5 Terminal-Bench 4.0 达 64%,比上代暴涨 50 分

ArtificialAnlys · x · 2026-09-29

Artificial Analysis 补充 Claude Sonnet 5.5 在 Terminal-Bench 系列的成绩:Terminal-Bench 4.0 得分 64%,比 Sonnet 5 (max) 提升 50 个百分点,略高于 Opus 5.5 与 GPT-6 Astra 的 60%。在新榜单 Terminal-Bench-Science(考察用 agent 终端完成跨领域真实科研工作流)上得 53%,仅次于 GPT-6 Astra 和 Opus 5.5;该榜单暂未纳入智能指数。

所属事件:Sonnet 5.5 评测:智能逼近 Opus,token 消耗登顶(12 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →