Claude Sonnet 5.5 发布:智能逼近 Opus,但成 token 效率争议焦点
Anthropic 发布中端新模型 Claude Sonnet 5.5(价格为 Opus 5.5 的一半),第三方评测与实测反馈迅速铺开:智能水平逼近旗舰 Opus 5.5,但 token 消耗与成本效率成为最大争议点。整体口碑「聪明但昂贵」,是否升级取决于使用场景。
已确认
- Artificial Analysis 实测智能指数:max 档 56 分,仅比 Opus 5.5 (max) 低 2 分;五档推理力度(max 56、xhigh 52、high 47、medium 41 等)价差 18 倍,单任务成本 $0.41 到 $7.60
- Terminal-Bench 4.0 得分 64%,比 Sonnet 5 (max) 提升 50 个百分点
- AA 测得 max effort 单任务平均消耗约 19.3 万输出 token,为所有已测模型最高,约为 GPT-6 Astra 的 7 倍;Reddit 用户 @Roflxd88 指其在 Intelligence Index 上累计输出 4.1 亿 token,成「最啰嗦」模型
- @every 团队实测:比 Sonnet 5 快约 30%,多数工作场景成本最高降 30%;Dan Shipper 在其私有写作基准 Dan's Editorial Checks(7 模型 5 任务)中测得总分 65%、段落修订 90%,写作能力甚至优于 Opus 5.5
- @Duex 自建盲测(Rust 版 DEFLATE/zlib 解压器任务):正确率追平 Opus 5.5,价格仅约四分之一
- 评测人 Matthew Berman 早期体验称其基本达到 Opus 5.5 水平,价格便宜 50%、速度更快
尚未确认
- @haider1(7 万粉丝 AI 从业者)实测后质疑 Sonnet 5.5「刷榜」:分数亮眼但明显更贵、更费 token,AA 指数上的成本与 token 效率甚至差于 Sonnet 5
- Reddit 用户 @Gohab2001 质疑 Anthropic 为何发布这样定位的模型(疑似面向特定场景)
为什么重要
- 智能指数前五名中四席被 Claude 包揽(@Hesamation 转述 AA 数据),显示 Anthropic 在模型能力上的强势地位
- Sonnet 5.5 展示了「以 token 换智能」的路线:能力逼近旗舰但效率指标反超上代恶化,为高推理力度模式的成本定价争议提供了新案例
- Every 团队选型建议分化:适合短轮次反馈迭代、规划类协作场景升级;Coding 场景 Kieran Klaassen 认为 Sonnet 5 仍够用;Katie Parrott 强调它更好的协作伙伴,但使用者要保持掌控、知道何时升级调用
2026-09-29 ~ 2026-09-29 · 27 条相关
- 第 1 集:爆料称 OpenAI 与 Anthropic 内部模型领先公开发布版(2026-09-24,2 条)
- 第 2 集:传 Anthropic 将赶在 OpenAI DevDay 前发布 Claude 5.5(2026-09-26,2 条)
- 第 3 集:Claude Sonnet 5.5 泄露:灰度已开、发布倒计时(2026-09-27,20 条)
- 第 4 集:爆料称 OpenAI 手握更强模型却压着不发(2026-09-28,2 条)
- 第 5 集:传 Anthropic DevDay 前夕突袭发 Opus 5.5 与 Sonnet 5.5(2026-09-29,7 条)
- 第 6 集:Anthropic 发布 Claude Sonnet 5.5:快 30%、多数任务成本降三成(2026-09-29,58 条)
- 第 7 集:Claude Sonnet 5.5 发布:智能逼近 Opus,但成 token 效率争议焦点(2026-09-29,27 条)
- 第 8 集:多方爆料称 Claude Sonnet 5.5 跑分碾压 GPT-6 sol(2026-09-29,5 条)
- 第 9 集:数据对比引争议 Sonnet 5.5 被评失败发布(2026-09-29,2 条)
一手来源
- Artificial Analysis 实测 Sonnet 5.5:距 Opus 5.5 仅 2 分,但单任务耗 token 最高 — ArtificialAnlys ·
- Sonnet 5.5 定价仅 Opus 一半,Every 团队一周实测:好用但有分歧 — every ·
- Sonnet 5.5 是 token 吞金兽:单任务 193k 输出,成本 2 倍于 GPT-6 — haider1 ·
- 实测称 Sonnet 5.5 接近 Opus 5.5,便宜一半且更快 — EricBuess · 2026-09-29
- 【源头】Artificial Analysis 实测 Sonnet 5.5:距 Opus 5.5 仅 2 分,但单任务耗 token 最高 — ArtificialAnlys · 2026-09-29
- Sonnet 5.5 Terminal-Bench 4.0 达 64%,比上代暴涨 50 分 — ArtificialAnlys · 2026-09-29
- AA 实测:Claude Sonnet 5.5 单任务烧 19.3 万输出 token,是 GPT-6 Astra 的 7 倍 — ArtificialAnlys · 2026-09-29
- Artificial Analysis 发布 Claude Sonnet 5.5 全评测明细与各档推理力度对比 — ArtificialAnlys · 2026-09-29
- Claude Sonnet 5.5 五档模型价差 18 倍:单任务成本 $0.41 到 $7.60 — ArtificialAnlys · 2026-09-29
- Hesamation:AA 智能指数前五最聪明模型中四席被 Claude 包揽 — Hesamation · 2026-09-29
- AA 智能指数前五占四席,Sonnet 5.5 分数超 Fable 5.1 — xiaosun86 · 2026-09-29
- Sonnet 5.5 创 Artificial Analysis 输出 token 新纪录且运行更便宜 — Gohab2001 · 2026-09-29
- Anthropic 发布 Claude Sonnet 5.5:评测得分距 Opus 5.5 仅 2 分 — jarrodwatts · 2026-09-29
- 【源头】Sonnet 5.5 是 token 吞金兽:单任务 193k 输出,成本 2 倍于 GPT-6 — haider1 · 2026-09-29
- 自建盲测:Sonnet 5.5 正确率追平 Opus 5.5,价格仅四分之一 — _Duex · 2026-09-29
- 博主点评:Sonnet 5.5 综合表现已超 Opus 5.5 与 Fable 5.1 — AiBreakfast · 2026-09-29
- Sonnet 5.5 发布获「Opus 级」升级,写作能力反超旗舰 — every · 2026-09-29
- Every 实测 Claude Sonnet 5.5:比 Sonnet 5 快 30% 且更便宜 — danshipper · 2026-09-29
- Every 团队实测 Sonnet 5.5:token 半价但高 effort 吃 token 快,写作可读性追平 Opus — kieranklaassen · 2026-09-29
- Sonnet 5.5 发布:评测称比 Sonnet 5 更强,但仍需人盯方向盘 — kieranklaassen · 2026-09-29
- Sonnet 5.5 部分评测逼近 Opus 5.5,但 OpenAI 仍占 token 效率优势 — cedric_chee · 2026-09-29
- Every 实测 Sonnet 5.5:快 30%、多数任务便宜最多三成 — every · 2026-09-29
- Every 实测 Sonnet 5.5:修复 Claude Code bug,快 30% 且用量省 30% — every · 2026-09-29
- Sonnet 5.5 实测:延续 Opus 手感,可读性登顶,能力大幅跃升 — every · 2026-09-29
- 用户实测:Sonnet 5.5 更快更省,比 5.0 便宜约 30% — shaunralston · 2026-09-29
- Sonnet 5.5 被指刷榜:成绩亮眼但成本与 token 效率反超上代 — haider1 · 2026-09-29
- 【源头】Sonnet 5.5 定价仅 Opus 一半,Every 团队一周实测:好用但有分歧 — every · 2026-09-29
- 实测一周后给建议:Sonnet 5.5 协作更强,Coding 场景 Sonnet 5 仍够用 — every · 2026-09-29
- Sonnet 5.5 单次跑出 4.1 亿输出 token,成最啰嗦模型 — Roflxd88 · 2026-09-29
- Sonnet 5.5实测:成本砍半快30%,执行模型首选 — 卡尔的AI沃茨 · 2026-09-29