专题 · FULL STORY

Claude Sonnet 5.5:半价发布到跑分登顶

Anthropic 于 9 月 29 日发布 Claude 5.5 家族第二款模型 Sonnet 5.5,官方称相较 Sonnet 5 明确升级且价格减半。随后多方爆料其跑分显著领先 GPT-6 sol,第三方评测显示其智能逼近 Opus,但 token 消耗居首。

2026-09-29 ~ 2026-09-29 · 3 集 · 28 条

第 1 集 · Anthropic 发布 Sonnet 5.5:半价逼近旗舰(2026-09-29,11 条)

Anthropic 于 09-29 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,官方称相较 Sonnet 5 是一次明确升级,速度快约 30%。这是继 Opus 5.5 之后的「中间兄弟」定位产品,多家评测均认为其中端价格已逼近旗舰能力,写作等任务甚至局部反超。

已确认

  • Every 创始人 Dan Shipper 发布了完整的 vibe check 评测(编码、写作、设计与知识工作多角度):结论是 Sonnet 5.5 比 Sonnet 5 更聪明、更高效,速度快约 30%,多数工作场景成本最高降低 30%。
  • 在 Shipper 基于真实工作的私有写作基准 Dan's Editorial Checks(7 模型 5 任务)中,Sonnet 5.5 总分 65%,段落修订任务拿到 90% 高分,写作上甚至优于 Opus 5.5,可读性登顶。
  • 编码场景方面,评测案例显示 Sonnet 5.5 成功修复了 Claude Code 中的 bug;Shipper 还称其保留了 Opus 5.5 的「手感」,写作清晰、速度很快。
  • 按 token 计价是 Opus 5.5 的一半,但 Every 团队指出高 effort 模式下 token 消耗快,按任务算不一定省一半。
  • Every 团队试用一周后评价分化:开发者 Kieran Klaassen 称赞「这是一个特别的 Sonnet,配得上名字里的 .5」;评测作者 Katie Parrott 认为 Sonnet 5.5 是比 Sonnet 5 更好的协作伙伴,但前提是使用者保持掌控、知道何时升级调用更强模型。
  • Every 团队还给出选型建议:适合升级的场景包括需要短轮次反馈迭代做设计/构建、帮忙理大纲或规划项目、从中等力度开始边走边查;而 Kieran Klaassen 基于 15 个项目的经验认为,纯 Coding 场景下 Sonnet 5 仍够用,不必急着升级。

尚未确认

  • 评测人 Matthew Berman 在早期体验后称 Sonnet 5.5 基本达到 Opus 5.5 水平、价格便宜 50% 且速度明显更快,并附多条演示视频(含 3D 仿真实例),但这属于个人早期体验。
  • 用户 @shaunralston 分享初步体验称其比 Sonnet 5.0 更快更聪明,能力接近 Opus 5.5 且便宜约 30%,目前仅为个人使用印象,尚无官方数据佐证。

为什么重要

  • 多方独立评测一致指向同一结论:中端模型已能以 Opus 一半的 token 价格、最多三成的任务成本,提供接近甚至局部反超旗舰的能力,这对按用量计费的开发者与知识工作者意味着直接的成本下降。
  • 写作类任务上的反超表明 Claude 5.5 家族内部的梯度定位正在被打破,「买旗舰」不再必然是能力最优解;而 Every 的选型建议也为「哪些场景值得升级」提供了更具体的参照。

第 2 集 · 多方爆料称 Claude Sonnet 5.5 跑分碾压 GPT-6 sol(2026-09-29,5 条)

9 月 29 日,多个第三方信源集中爆料 Anthropic 的 Claude Sonnet 5.5 在跑分上显著领先 OpenAI 的 GPT-6 sol,引发社区对 OpenAI 竞争力的讨论。目前所有数据均来自非官方渠道,未被任何一方正式确认。

已确认

  • X 用户 ns123abc(8.4 万粉丝)发帖并附截图,称 GPT-6 sol 在对比中被 Claude Sonnet 5.5 大幅碾压(其原话为「brutally mogged」)。
  • LuminaBench 爆料称 Claude Sonnet 5.5 在 Artificial Analysis 智能指数(Intelligence Index)上拿到 56 分,竞品模型 Sol 为 48 分。
  • 有网友爆料称 Sonnet 5.5 智能指数 56 分,仅次于 Claude Opus 5.5,高于 GPT-6 Astra。
  • 账号 AIScreening 发布第三方实测截图,显示 Sonnet 5.5 大幅领先 GPT-6 sol,且与 GPT-6 Astra 的成绩非常接近。
  • 另有引用贴称,榜单上 Claude Sonnet 5.5 Max 排名第二,超过 GPT-6 Astra Max,仅略低于 Opus-5.5;评论区认为 OpenAI 处境不利。

尚未确认

  • 所有跑分与排名均来自爆料和第三方转发,测试基准、具体题目与版本细节不明,未经 Anthropic、OpenAI 或 Artificial Analysis 官方证实。
  • m1 所述对比的具体评测方法与来源截图未公开完整信息。

为什么重要

  • 若爆料属实,意味着 Anthropic 中端定位的 Sonnet 5.5 即可压制 OpenAI 的 GPT-6 sol 并逼近 GPT-6 Astra,将直接影响两大厂商的用户选择与市场叙事。
  • 多个独立账号同日集中传播相似结论,即使数值不精确,也反映社区对 OpenAI 前沿模型相对地位下滑的担忧情绪在升温。

第 3 集 · Sonnet 5.5 评测:智能逼近 Opus,token 消耗登顶(2026-09-29,12 条)

Anthropic 发布 Claude Sonnet 5.5 后,第三方评测机构 Artificial Analysis(AA)随即公布首批评测:该模型在 AA 智能指数上得 56 分,仅比 Opus 5.5(max)低 2 分,性能逼近自家旗舰;但 max effort 下单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,高消耗带来的成本问题成为本批评测的核心争议。

已确认

  • 智能指数 56 分,距 Opus 5.5(max)仅 2 分;AA 已公布各推理力度下智能指数单项评测完整明细。
  • AA 智能指数前五名模型中四席被 Claude 包揽,且 Sonnet 5.5 得分高于 Fable 5.1;@Hesamation 与 @xiaosun86 均指出这一点,后者推测 Anthropic 正把某个 Fable 系模型排除在前五之外(转述推测,非官方信息)。
  • max effort 档单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,约为 GPT-6 Astra 的 7 倍;对比 Opus 5.5 max 的 11.9 万,远超同系模型。
  • Terminal-Bench 4.0 得分 64%,较 Sonnet 5(max)提升 50 个百分点。
  • AA 模型对比页显示该系列 5 个推理力度档位(max/xhigh/high/medium 及更低档)智能指数分别为 56/52/47/41 分等,五档单任务成本从 $0.41 到 $7.60,价差达 18 倍。
  • Reddit 用户 @Gohab2001 转引 AA 数据指出,Sonnet 5.5 在创下输出 token 纪录的同时,运行 AA 的 Astra 组合反而比此前更便宜;该作者对 Anthropic 为何发布这一定位的模型表示困惑(疑似面向特定场景)。
  • 早期用户口碑方面,@cedricchee 汇总反馈称 Sonnet 5.5 速度很快、行文清晰、迭代体验好,基准成绩接近甚至在部分评测中反超 Opus 5.5,但复杂、开放式任务仍是 Opus 的主场;其同时提醒 OpenAI 模型仍占 token 效率优势,并警示对评测数字的常见解读误区。

尚未确认

  • AI 资讯博主 AiBreakfast 认为 Sonnet 5.5 的综合表现已排在 Opus 5.5 与 Fable 5.1 之上,但该观点仅为简短排序判断,未附具体测试数据。
  • @Hesamation 猜测 Anthropic 向 Opus 和 Sonnet 之外的产品线(如 Fable)释放了某种策略信号,属个人推测。

为什么重要

  • Sonnet 5.5 以中端定位逼近旗舰性能,体现 Anthropic 在推理力度分级上的策略,但高消耗意味着实际使用成本可能翻倍:@haider1 的成本核算称其为「token 吞金兽」,单任务成本约为 GPT-6 的 2 倍;而 @Gohab2001 的观察提示,token 量最高不等于综合成本必然最高,需结合具体基准组合看待。
  • AA 智能指数前五占四席的局面显示 Claude 系列在第三方综合评测中的强势地位,Sonnet 5.5 甚至压过 Fable 5.1,中端模型与旗舰/竞品的边界正在模糊。
  • 对按 token 计费的开发者而言,智能指数与单位成本需综合权衡,AA 的五档明细(单任务成本 $0.41 至 $7.60)为选型提供了直接参考。