AA 评测 Sonnet 5.5:性能逼近旗舰,token 消耗最高

Anthropic 发布 Claude Sonnet 5.5 后,第三方评测机构 Artificial Analysis(AA)随即公布首批评测:该模型在 AA 智能指数上得 56 分,仅比 Opus 5.5(max)低 2 分,性能逼近自家旗舰;但 max effort 下单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,高消耗带来的成本问题成为本批评测的核心争议。

已确认

尚未确认

为什么重要

2026-09-29 ~ 2026-09-29 · 8 条相关

事件全程(共 2 集)→

一手来源