专题 · FULL STORY
Claude Sonnet 5.5:从传闻到实测
Claude Sonnet 5.5 发布前即传出智能指数 56 分、逼近 Opus 5.5 的爆料;正式发布后,Artificial Analysis 等第三方评测证实其性能接近 Opus,写作能力追平,token 半价但高 effort 下消耗创纪录。
2026-09-29 ~ 2026-09-29 · 3 集 · 17 条
第 1 集 · 传Claude Sonnet 5.5智能指数56分,逼近Opus 5.5(2026-09-29,3 条)
有网友和LuminaBench爆料称,Claude Sonnet 5.5在Artificial Analysis智能指数上获得56分,排名第二,仅次于Claude Opus 5.5,并超越GPT-6 Astra等竞品;爆料还提及竞品模型Sol为48分。上述信息为引用和传闻,尚未得到官方确认。
- 传 Claude Sonnet 5.5 智能指数得 56 分,仅次于 Opus 5.5 — thesaraharminta · 2026-09-29
- 爆料称 Claude Sonnet 5.5 智能指数达 56,超越 Opus 5.5 — airesearch12 · 2026-09-29
- Claude Sonnet 5.5 Max 排第二,AI 指数榜逼近 Opus-5.5 压过 GPT-6 — airesearch12 · 2026-09-29
第 2 集 · Sonnet 5.5 评测:智能逼近 Opus,token 消耗登顶(2026-09-29,12 条)
Anthropic 发布 Claude Sonnet 5.5 后,第三方评测机构 Artificial Analysis(AA)随即公布首批评测:该模型在 AA 智能指数上得 56 分,仅比 Opus 5.5(max)低 2 分,性能逼近自家旗舰;但 max effort 下单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,高消耗带来的成本问题成为本批评测的核心争议。
已确认
- 智能指数 56 分,距 Opus 5.5(max)仅 2 分;AA 已公布各推理力度下智能指数单项评测完整明细。
- AA 智能指数前五名模型中四席被 Claude 包揽,且 Sonnet 5.5 得分高于 Fable 5.1;@Hesamation 与 @xiaosun86 均指出这一点,后者推测 Anthropic 正把某个 Fable 系模型排除在前五之外(转述推测,非官方信息)。
- max effort 档单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,约为 GPT-6 Astra 的 7 倍;对比 Opus 5.5 max 的 11.9 万,远超同系模型。
- Terminal-Bench 4.0 得分 64%,较 Sonnet 5(max)提升 50 个百分点。
- AA 模型对比页显示该系列 5 个推理力度档位(max/xhigh/high/medium 及更低档)智能指数分别为 56/52/47/41 分等,五档单任务成本从 $0.41 到 $7.60,价差达 18 倍。
- Reddit 用户 @Gohab2001 转引 AA 数据指出,Sonnet 5.5 在创下输出 token 纪录的同时,运行 AA 的 Astra 组合反而比此前更便宜;该作者对 Anthropic 为何发布这一定位的模型表示困惑(疑似面向特定场景)。
- 早期用户口碑方面,@cedricchee 汇总反馈称 Sonnet 5.5 速度很快、行文清晰、迭代体验好,基准成绩接近甚至在部分评测中反超 Opus 5.5,但复杂、开放式任务仍是 Opus 的主场;其同时提醒 OpenAI 模型仍占 token 效率优势,并警示对评测数字的常见解读误区。
尚未确认
- AI 资讯博主 AiBreakfast 认为 Sonnet 5.5 的综合表现已排在 Opus 5.5 与 Fable 5.1 之上,但该观点仅为简短排序判断,未附具体测试数据。
- @Hesamation 猜测 Anthropic 向 Opus 和 Sonnet 之外的产品线(如 Fable)释放了某种策略信号,属个人推测。
为什么重要
- Sonnet 5.5 以中端定位逼近旗舰性能,体现 Anthropic 在推理力度分级上的策略,但高消耗意味着实际使用成本可能翻倍:@haider1 的成本核算称其为「token 吞金兽」,单任务成本约为 GPT-6 的 2 倍;而 @Gohab2001 的观察提示,token 量最高不等于综合成本必然最高,需结合具体基准组合看待。
- AA 智能指数前五占四席的局面显示 Claude 系列在第三方综合评测中的强势地位,Sonnet 5.5 甚至压过 Fable 5.1,中端模型与旗舰/竞品的边界正在模糊。
- 对按 token 计费的开发者而言,智能指数与单位成本需综合权衡,AA 的五档明细(单任务成本 $0.41 至 $7.60)为选型提供了直接参考。
- Artificial Analysis 实测 Sonnet 5.5:距 Opus 5.5 仅 2 分,但单任务耗 token 最高 — ArtificialAnlys · 2026-09-29
- Sonnet 5.5 Terminal-Bench 4.0 达 64%,比上代暴涨 50 分 — ArtificialAnlys · 2026-09-29
- AA 实测:Claude Sonnet 5.5 单任务烧 19.3 万输出 token,是 GPT-6 Astra 的 7 倍 — ArtificialAnlys · 2026-09-29
- Artificial Analysis 发布 Claude Sonnet 5.5 全评测明细与各档推理力度对比 — ArtificialAnlys · 2026-09-29
- Claude Sonnet 5.5 五档模型价差 18 倍:单任务成本 $0.41 到 $7.60 — ArtificialAnlys · 2026-09-29
- Hesamation:AA 智能指数前五最聪明模型中四席被 Claude 包揽 — Hesamation · 2026-09-29
- AA 智能指数前五占四席,Sonnet 5.5 分数超 Fable 5.1 — xiaosun86 · 2026-09-29
- Sonnet 5.5 创 Artificial Analysis 输出 token 新纪录且运行更便宜 — Gohab2001 · 2026-09-29
- Anthropic 发布 Claude Sonnet 5.5:评测得分距 Opus 5.5 仅 2 分 — jarrodwatts · 2026-09-29
- Sonnet 5.5 是 token 吞金兽:单任务 193k 输出,成本 2 倍于 GPT-6 — haider1 · 2026-09-29
- 博主点评:Sonnet 5.5 综合表现已超 Opus 5.5 与 Fable 5.1 — AiBreakfast · 2026-09-29
- Sonnet 5.5 部分评测逼近 Opus 5.5,但 OpenAI 仍占 token 效率优势 — cedric_chee · 2026-09-29
第 3 集 · Sonnet 5.5 实测:写作追平 Opus,token 半价但高 effort 消耗快(2026-09-29,2 条)
Anthropic 新发布的 Sonnet 5.5 获「Opus 级」升级,写作能力大幅提升。Dan Shipper 在其基于真实工作的私有基准(7 模型 5 任务)实测中总分达 65,认为写作能力反超旗舰;Every 团队也从编码、写作、设计与知识工作多角度实测,发现其写作可读性已追平 Opus。该模型 token 价格减半,但在高 effort 模式下 token 消耗较快,定位介于旗舰 Opus 5.5 之后的「中间兄弟」。
- Sonnet 5.5 发布获「Opus 级」升级,写作能力反超旗舰 — every · 2026-09-29
- Every 团队实测 Sonnet 5.5:token 半价但高 effort 吃 token 快,写作可读性追平 Opus — kieranklaassen · 2026-09-29