专题 · FULL STORY

Claude Sonnet 5.5:从传闻到实测

Claude Sonnet 5.5 发布前即传出智能指数 56 分、逼近 Opus 5.5 的爆料;正式发布后,Artificial Analysis 等第三方评测证实其性能接近 Opus,写作能力追平,token 半价但高 effort 下消耗创纪录。

2026-09-29 ~ 2026-09-29 · 3 集 · 17 条

第 1 集 · 传Claude Sonnet 5.5智能指数56分,逼近Opus 5.5(2026-09-29,3 条)

有网友和LuminaBench爆料称,Claude Sonnet 5.5在Artificial Analysis智能指数上获得56分,排名第二,仅次于Claude Opus 5.5,并超越GPT-6 Astra等竞品;爆料还提及竞品模型Sol为48分。上述信息为引用和传闻,尚未得到官方确认。

第 2 集 · Sonnet 5.5 评测:智能逼近 Opus,token 消耗登顶(2026-09-29,12 条)

Anthropic 发布 Claude Sonnet 5.5 后,第三方评测机构 Artificial Analysis(AA)随即公布首批评测:该模型在 AA 智能指数上得 56 分,仅比 Opus 5.5(max)低 2 分,性能逼近自家旗舰;但 max effort 下单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,高消耗带来的成本问题成为本批评测的核心争议。

已确认

  • 智能指数 56 分,距 Opus 5.5(max)仅 2 分;AA 已公布各推理力度下智能指数单项评测完整明细。
  • AA 智能指数前五名模型中四席被 Claude 包揽,且 Sonnet 5.5 得分高于 Fable 5.1;@Hesamation 与 @xiaosun86 均指出这一点,后者推测 Anthropic 正把某个 Fable 系模型排除在前五之外(转述推测,非官方信息)。
  • max effort 档单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,约为 GPT-6 Astra 的 7 倍;对比 Opus 5.5 max 的 11.9 万,远超同系模型。
  • Terminal-Bench 4.0 得分 64%,较 Sonnet 5(max)提升 50 个百分点。
  • AA 模型对比页显示该系列 5 个推理力度档位(max/xhigh/high/medium 及更低档)智能指数分别为 56/52/47/41 分等,五档单任务成本从 $0.41 到 $7.60,价差达 18 倍。
  • Reddit 用户 @Gohab2001 转引 AA 数据指出,Sonnet 5.5 在创下输出 token 纪录的同时,运行 AA 的 Astra 组合反而比此前更便宜;该作者对 Anthropic 为何发布这一定位的模型表示困惑(疑似面向特定场景)。
  • 早期用户口碑方面,@cedricchee 汇总反馈称 Sonnet 5.5 速度很快、行文清晰、迭代体验好,基准成绩接近甚至在部分评测中反超 Opus 5.5,但复杂、开放式任务仍是 Opus 的主场;其同时提醒 OpenAI 模型仍占 token 效率优势,并警示对评测数字的常见解读误区。

尚未确认

  • AI 资讯博主 AiBreakfast 认为 Sonnet 5.5 的综合表现已排在 Opus 5.5 与 Fable 5.1 之上,但该观点仅为简短排序判断,未附具体测试数据。
  • @Hesamation 猜测 Anthropic 向 Opus 和 Sonnet 之外的产品线(如 Fable)释放了某种策略信号,属个人推测。

为什么重要

  • Sonnet 5.5 以中端定位逼近旗舰性能,体现 Anthropic 在推理力度分级上的策略,但高消耗意味着实际使用成本可能翻倍:@haider1 的成本核算称其为「token 吞金兽」,单任务成本约为 GPT-6 的 2 倍;而 @Gohab2001 的观察提示,token 量最高不等于综合成本必然最高,需结合具体基准组合看待。
  • AA 智能指数前五占四席的局面显示 Claude 系列在第三方综合评测中的强势地位,Sonnet 5.5 甚至压过 Fable 5.1,中端模型与旗舰/竞品的边界正在模糊。
  • 对按 token 计费的开发者而言,智能指数与单位成本需综合权衡,AA 的五档明细(单任务成本 $0.41 至 $7.60)为选型提供了直接参考。

第 3 集 · Sonnet 5.5 实测:写作追平 Opus,token 半价但高 effort 消耗快(2026-09-29,2 条)

Anthropic 新发布的 Sonnet 5.5 获「Opus 级」升级,写作能力大幅提升。Dan Shipper 在其基于真实工作的私有基准(7 模型 5 任务)实测中总分达 65,认为写作能力反超旗舰;Every 团队也从编码、写作、设计与知识工作多角度实测,发现其写作可读性已追平 Opus。该模型 token 价格减半,但在高 effort 模式下 token 消耗较快,定位介于旗舰 Opus 5.5 之后的「中间兄弟」。