专题 · FULL STORY
Claude Sonnet 5.5:半价发布到跑分登顶
Anthropic 于 9 月 29 日发布 Claude 5.5 家族第二款模型 Sonnet 5.5,官方称相较 Sonnet 5 明确升级且价格减半。随后多方爆料其跑分显著领先 GPT-6 sol,第三方评测显示其智能逼近 Opus,但 token 消耗居首。
2026-09-29 ~ 2026-09-29 · 3 集 · 28 条
第 1 集 · Anthropic 发布 Sonnet 5.5:半价逼近旗舰(2026-09-29,11 条)
Anthropic 于 09-29 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,官方称相较 Sonnet 5 是一次明确升级,速度快约 30%。这是继 Opus 5.5 之后的「中间兄弟」定位产品,多家评测均认为其中端价格已逼近旗舰能力,写作等任务甚至局部反超。
已确认
- Every 创始人 Dan Shipper 发布了完整的 vibe check 评测(编码、写作、设计与知识工作多角度):结论是 Sonnet 5.5 比 Sonnet 5 更聪明、更高效,速度快约 30%,多数工作场景成本最高降低 30%。
- 在 Shipper 基于真实工作的私有写作基准 Dan's Editorial Checks(7 模型 5 任务)中,Sonnet 5.5 总分 65%,段落修订任务拿到 90% 高分,写作上甚至优于 Opus 5.5,可读性登顶。
- 编码场景方面,评测案例显示 Sonnet 5.5 成功修复了 Claude Code 中的 bug;Shipper 还称其保留了 Opus 5.5 的「手感」,写作清晰、速度很快。
- 按 token 计价是 Opus 5.5 的一半,但 Every 团队指出高 effort 模式下 token 消耗快,按任务算不一定省一半。
- Every 团队试用一周后评价分化:开发者 Kieran Klaassen 称赞「这是一个特别的 Sonnet,配得上名字里的 .5」;评测作者 Katie Parrott 认为 Sonnet 5.5 是比 Sonnet 5 更好的协作伙伴,但前提是使用者保持掌控、知道何时升级调用更强模型。
- Every 团队还给出选型建议:适合升级的场景包括需要短轮次反馈迭代做设计/构建、帮忙理大纲或规划项目、从中等力度开始边走边查;而 Kieran Klaassen 基于 15 个项目的经验认为,纯 Coding 场景下 Sonnet 5 仍够用,不必急着升级。
尚未确认
- 评测人 Matthew Berman 在早期体验后称 Sonnet 5.5 基本达到 Opus 5.5 水平、价格便宜 50% 且速度明显更快,并附多条演示视频(含 3D 仿真实例),但这属于个人早期体验。
- 用户 @shaunralston 分享初步体验称其比 Sonnet 5.0 更快更聪明,能力接近 Opus 5.5 且便宜约 30%,目前仅为个人使用印象,尚无官方数据佐证。
为什么重要
- 多方独立评测一致指向同一结论:中端模型已能以 Opus 一半的 token 价格、最多三成的任务成本,提供接近甚至局部反超旗舰的能力,这对按用量计费的开发者与知识工作者意味着直接的成本下降。
- 写作类任务上的反超表明 Claude 5.5 家族内部的梯度定位正在被打破,「买旗舰」不再必然是能力最优解;而 Every 的选型建议也为「哪些场景值得升级」提供了更具体的参照。
- 实测称 Sonnet 5.5 接近 Opus 5.5,便宜一半且更快 — EricBuess · 2026-09-29
- Sonnet 5.5 发布获「Opus 级」升级,写作能力反超旗舰 — every · 2026-09-29
- Every 实测 Claude Sonnet 5.5:比 Sonnet 5 快 30% 且更便宜 — danshipper · 2026-09-29
- Every 团队实测 Sonnet 5.5:token 半价但高 effort 吃 token 快,写作可读性追平 Opus — kieranklaassen · 2026-09-29
- Sonnet 5.5 发布:评测称比 Sonnet 5 更强,但仍需人盯方向盘 — kieranklaassen · 2026-09-29
- Every 实测 Sonnet 5.5:快 30%、多数任务便宜最多三成 — every · 2026-09-29
- Every 实测 Sonnet 5.5:修复 Claude Code bug,快 30% 且用量省 30% — every · 2026-09-29
- Sonnet 5.5 实测:延续 Opus 手感,可读性登顶,能力大幅跃升 — every · 2026-09-29
- 用户实测:Sonnet 5.5 更快更省,比 5.0 便宜约 30% — shaunralston · 2026-09-29
- Sonnet 5.5 定价仅 Opus 一半,Every 团队一周实测:好用但有分歧 — every · 2026-09-29
- 实测一周后给建议:Sonnet 5.5 协作更强,Coding 场景 Sonnet 5 仍够用 — every · 2026-09-29
第 2 集 · 多方爆料称 Claude Sonnet 5.5 跑分碾压 GPT-6 sol(2026-09-29,5 条)
9 月 29 日,多个第三方信源集中爆料 Anthropic 的 Claude Sonnet 5.5 在跑分上显著领先 OpenAI 的 GPT-6 sol,引发社区对 OpenAI 竞争力的讨论。目前所有数据均来自非官方渠道,未被任何一方正式确认。
已确认
- X 用户 ns123abc(8.4 万粉丝)发帖并附截图,称 GPT-6 sol 在对比中被 Claude Sonnet 5.5 大幅碾压(其原话为「brutally mogged」)。
- LuminaBench 爆料称 Claude Sonnet 5.5 在 Artificial Analysis 智能指数(Intelligence Index)上拿到 56 分,竞品模型 Sol 为 48 分。
- 有网友爆料称 Sonnet 5.5 智能指数 56 分,仅次于 Claude Opus 5.5,高于 GPT-6 Astra。
- 账号 AIScreening 发布第三方实测截图,显示 Sonnet 5.5 大幅领先 GPT-6 sol,且与 GPT-6 Astra 的成绩非常接近。
- 另有引用贴称,榜单上 Claude Sonnet 5.5 Max 排名第二,超过 GPT-6 Astra Max,仅略低于 Opus-5.5;评论区认为 OpenAI 处境不利。
尚未确认
- 所有跑分与排名均来自爆料和第三方转发,测试基准、具体题目与版本细节不明,未经 Anthropic、OpenAI 或 Artificial Analysis 官方证实。
- m1 所述对比的具体评测方法与来源截图未公开完整信息。
为什么重要
- 若爆料属实,意味着 Anthropic 中端定位的 Sonnet 5.5 即可压制 OpenAI 的 GPT-6 sol 并逼近 GPT-6 Astra,将直接影响两大厂商的用户选择与市场叙事。
- 多个独立账号同日集中传播相似结论,即使数值不精确,也反映社区对 OpenAI 前沿模型相对地位下滑的担忧情绪在升温。
- 传 Claude Sonnet 5.5 智能指数得 56 分,仅次于 Opus 5.5 — thesaraharminta · 2026-09-29
- 爆料称 OpenAI GPT-6 sol 被 Claude Sonnet 5.5 大幅碾压 — ns123abc · 2026-09-29
- 爆料称 Claude Sonnet 5.5 智能指数达 56,超越 Opus 5.5 — airesearch12 · 2026-09-29
- Claude Sonnet 5.5 Max 排第二,AI 指数榜逼近 Opus-5.5 压过 GPT-6 — airesearch12 · 2026-09-29
- 第三方实测称 Claude Sonnet 5.5 大幅领先 GPT-6 sol,接近 GPT-6 Astra — rickasaurus · 2026-09-29
第 3 集 · Sonnet 5.5 评测:智能逼近 Opus,token 消耗登顶(2026-09-29,12 条)
Anthropic 发布 Claude Sonnet 5.5 后,第三方评测机构 Artificial Analysis(AA)随即公布首批评测:该模型在 AA 智能指数上得 56 分,仅比 Opus 5.5(max)低 2 分,性能逼近自家旗舰;但 max effort 下单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,高消耗带来的成本问题成为本批评测的核心争议。
已确认
- 智能指数 56 分,距 Opus 5.5(max)仅 2 分;AA 已公布各推理力度下智能指数单项评测完整明细。
- AA 智能指数前五名模型中四席被 Claude 包揽,且 Sonnet 5.5 得分高于 Fable 5.1;@Hesamation 与 @xiaosun86 均指出这一点,后者推测 Anthropic 正把某个 Fable 系模型排除在前五之外(转述推测,非官方信息)。
- max effort 档单任务平均消耗约 19.3 万输出 token,为所有已测模型中最高,约为 GPT-6 Astra 的 7 倍;对比 Opus 5.5 max 的 11.9 万,远超同系模型。
- Terminal-Bench 4.0 得分 64%,较 Sonnet 5(max)提升 50 个百分点。
- AA 模型对比页显示该系列 5 个推理力度档位(max/xhigh/high/medium 及更低档)智能指数分别为 56/52/47/41 分等,五档单任务成本从 $0.41 到 $7.60,价差达 18 倍。
- Reddit 用户 @Gohab2001 转引 AA 数据指出,Sonnet 5.5 在创下输出 token 纪录的同时,运行 AA 的 Astra 组合反而比此前更便宜;该作者对 Anthropic 为何发布这一定位的模型表示困惑(疑似面向特定场景)。
- 早期用户口碑方面,@cedricchee 汇总反馈称 Sonnet 5.5 速度很快、行文清晰、迭代体验好,基准成绩接近甚至在部分评测中反超 Opus 5.5,但复杂、开放式任务仍是 Opus 的主场;其同时提醒 OpenAI 模型仍占 token 效率优势,并警示对评测数字的常见解读误区。
尚未确认
- AI 资讯博主 AiBreakfast 认为 Sonnet 5.5 的综合表现已排在 Opus 5.5 与 Fable 5.1 之上,但该观点仅为简短排序判断,未附具体测试数据。
- @Hesamation 猜测 Anthropic 向 Opus 和 Sonnet 之外的产品线(如 Fable)释放了某种策略信号,属个人推测。
为什么重要
- Sonnet 5.5 以中端定位逼近旗舰性能,体现 Anthropic 在推理力度分级上的策略,但高消耗意味着实际使用成本可能翻倍:@haider1 的成本核算称其为「token 吞金兽」,单任务成本约为 GPT-6 的 2 倍;而 @Gohab2001 的观察提示,token 量最高不等于综合成本必然最高,需结合具体基准组合看待。
- AA 智能指数前五占四席的局面显示 Claude 系列在第三方综合评测中的强势地位,Sonnet 5.5 甚至压过 Fable 5.1,中端模型与旗舰/竞品的边界正在模糊。
- 对按 token 计费的开发者而言,智能指数与单位成本需综合权衡,AA 的五档明细(单任务成本 $0.41 至 $7.60)为选型提供了直接参考。
- Artificial Analysis 实测 Sonnet 5.5:距 Opus 5.5 仅 2 分,但单任务耗 token 最高 — ArtificialAnlys · 2026-09-29
- Sonnet 5.5 Terminal-Bench 4.0 达 64%,比上代暴涨 50 分 — ArtificialAnlys · 2026-09-29
- AA 实测:Claude Sonnet 5.5 单任务烧 19.3 万输出 token,是 GPT-6 Astra 的 7 倍 — ArtificialAnlys · 2026-09-29
- Artificial Analysis 发布 Claude Sonnet 5.5 全评测明细与各档推理力度对比 — ArtificialAnlys · 2026-09-29
- Claude Sonnet 5.5 五档模型价差 18 倍:单任务成本 $0.41 到 $7.60 — ArtificialAnlys · 2026-09-29
- Hesamation:AA 智能指数前五最聪明模型中四席被 Claude 包揽 — Hesamation · 2026-09-29
- AA 智能指数前五占四席,Sonnet 5.5 分数超 Fable 5.1 — xiaosun86 · 2026-09-29
- Sonnet 5.5 创 Artificial Analysis 输出 token 新纪录且运行更便宜 — Gohab2001 · 2026-09-29
- Anthropic 发布 Claude Sonnet 5.5:评测得分距 Opus 5.5 仅 2 分 — jarrodwatts · 2026-09-29
- Sonnet 5.5 是 token 吞金兽:单任务 193k 输出,成本 2 倍于 GPT-6 — haider1 · 2026-09-29
- 博主点评:Sonnet 5.5 综合表现已超 Opus 5.5 与 Fable 5.1 — AiBreakfast · 2026-09-29
- Sonnet 5.5 部分评测逼近 Opus 5.5,但 OpenAI 仍占 token 效率优势 — cedric_chee · 2026-09-29