专题 · FULL STORY

Claude Sonnet 5.5:从传闻到发布与争议

9 月下旬先有 OpenAI 与 Anthropic 藏有更强内部模型的爆料,随后消息称 Anthropic 将赶在 OpenAI DevDay 前发布 Claude 5.5。9 月 29 日 Sonnet 5.5 正式亮相,评测称智能逼近 Opus 且跑分领先 GPT-6 sol,但 token 效率与同价对比数据引发争议。

2026-09-24 ~ 2026-09-30 · 9 集 · 125 条

第 1 集 · 爆料称 OpenAI 与 Anthropic 内部模型领先公开发布版(2026-09-24,2 条)

有传闻称 OpenAI 与 Anthropic 的内部模型领先其公开发布版本约两个月。网友进一步爆料称两家公司都藏着远超当前最强模型的内部版本,Anthropic 的下一代模型或命名为 Opus 5.5,OpenAI 为 GPT-6 Astra,xAI 则是 Fable 5.1,且有 X 用户直接指 Anthropic 在「藏拙」。

第 2 集 · 传 Anthropic 将赶在 OpenAI DevDay 前发布 Claude 5.5(2026-09-26,2 条)

OpenAI DevDay 举办前夕,社区热议 Anthropic 的动向。Anthropic 已确认 Claude Sonnet 5.5 与 Haiku 5.5 将在未来几周内发布,有观点认为这是对 OpenAI DevDay 的「截胡」。但也有发帖人质疑其产品策略:如果 Opus 已能在同价位提供更强能力,新模型的定位与差异化令人困惑。

第 3 集 · Claude Sonnet 5.5 泄露:灰度已开、发布倒计时(2026-09-27,20 条)

9 月 27 日起,X 与 Reddit 上集中流传 Anthropic 即将发布 Claude Sonnet 5.5 的消息,多位爆料者口径互为印证。截至 9 月 29 日,Claude Code 更新代码中已出现 claude-sonnet-5-5 模型标识符,模型列表开始现身,灰度测试据称已扩大到更多用户;性能传闻超过 GPT-6 Sol、接近 Opus 5.5,定价约为其一半。但 Anthropic 官方始终未发公告,「已发布」的说法尚未坐实,全部信息仍属发布前传闻。

已确认

  • 目前没有任何 Anthropic 官方公告,所有信息均来自社交媒体爆料与泄露观察,本质上是待证实的传闻。
  • 开发者 @lyraxana 于 9 月 29 日发现最新 Claude Code 更新代码中出现 claude-sonnet-5-5 模型标识符;@Angaisb 同日也称 Sonnet 5.5 已开始出现在 Claude Code 的模型列表中,两处独立观察互相印证产品侧准备已就绪。
  • @kimmonismus 于 9 月 28 日称自己似乎已被路由到 Sonnet 5.5,并引用 @AiBattle 的消息称该模型的隐蔽灰度测试正扩大到更多用户,是灰度扩大说法最接近一手的来源。
  • 9 月 29 日 @testingcatalog 爆料称 Anthropic 正在 Claude 客户端和 API 双通道灰度上线 Sonnet 5.5,并附测试截图,可信度较高但未经官方确认。
  • 9 月 29 日 @dejavucoder 发帖称「Sonnet 5.5 来了」并附截图,@koltregaskes 也称该模型已发布,@KyeGomezB 转发的消息亦称已发布,但均无官方公告佐证,截图无法核实,可能是误读、测试界面或玩梗,真伪存疑。
  • 新智元等中文媒体跟进报道了上述泄露,未提供额外一手信息;Reddit 用户 @1411337 发帖称模型或于当日发布,社区开始蹲点。

尚未确认

  • 发布时间:各说法有出入。@MrSalio(经 @rickasaurus 转发)称纽约时间周一下午 2 点发布;@kimmonismus 转述称可能下周与 OpenAI DevDay 同期发布;新智元报道指向美国时间周二下午;@YashasGunderia 称最早 9 月 28 日当天或次日发布。爆料账号 Lyra 给出明确截止时间 2026-09-28 11:00 PT 前,该账号以预测可靠著称,多位爆料者均援引其消息;但截至 9 月 29 日官方仍未官宣,截止时间已被突破。
  • 性能:Reddit 用户 @ResultBackground2450 贴出的截图称该模型此前已传闻在多项基准上「击败 GPT-6 Sol」,并在临发布前又获一次升级,具体幅度不明;@MrSalio 称早期测试显示其能力超过 GPT-6 Sol、接近 Opus 5.5。@YashasGunderia 还爆料其知识截止日期为 2026 年 8 月。@JustinHalford 转述的演示称 Sonnet 5.5 修复了 Claude Code 中的一个 bug,速度提升 30%、token 用量减少 30%,均为用户转述,未经官方确认。
  • 定价:泄露定价为输入 $2/M、输出 $10/M(缓存信息未完整披露),@danielmac8 称能力接近 Opus 5.5 而价格只有一半,据称显著低于旗舰。
  • 灰测与检查点:@kimmonismus 引用的实测反馈称灰测中速度极快、效率高,恢复了 Sonnet 4 那种「人味」;@lyraxana 称 Anthropic 合作伙伴已拿到质量更好的新检查点。
  • 竞争意图:@cedricchee 与 @danielmac8 称 Anthropic 计划把发布安排在 OpenAI DevDay 前后以「抢走对方的关注度」,属未经证实的圈内传闻。

为什么重要

  • 若定价与性能传闻属实,Sonnet 5.5 将以明显低于 Opus 5.5 的成本提供接近旗舰的能力,并直接对标 GPT-6 Sol,可能改变当前模型性价比格局;「速度+30%、用量-30%」的转述若坐实,将直接改善 Claude Code 的使用成本与体验。Claude Code 更新中出现模型标识符、模型列表现身等迹象意味着产品侧准备已就绪,发布进入倒计时。选择与 OpenAI DevDay 同期发布的说法(若属实)带有明显竞争意味,@cedricchee、@danielmac8 等开发者期待其复现 Opus 5 到 5.5 那样的代际跃升。

第 4 集 · 爆料称 OpenAI 手握更强模型却压着不发(2026-09-28,2 条)

博主 haider 发推称,Claude Opus 5.5 能成为当前最强模型,部分归因于 OpenAI 的策略失误:其内部已有更强的 Astra 继任者模型,却刻意压制发布节奏。他进一步爆料,Anthropic 与 OpenAI 内部都有比已发布版本更强的模型,谁先发布另一方就会迅速跟进,但发版慢主要卡在算力,并看好即将到来的 OpenAI DevDay。

第 5 集 · 传 Anthropic DevDay 前夕突袭发 Opus 5.5 与 Sonnet 5.5(2026-09-29,7 条)

9 月 29 日,Reddit 与 X 多名用户流传 Anthropic 在 OpenAI DevDay 前夕密集放出 Opus 5.5 与 Sonnet 5.5 两款模型,被普遍解读为对 OpenAI 发布周的「截胡」。所有信息均来自社区转述与个人爆料,Anthropic 与 OpenAI 均未官方证实任何型号或发布计划。

尚未确认

  • Reddit 用户 hibzy7 称 Opus 5.5 与 Sonnet 5.5 表现均超过 OpenAI 的 Sol 与 Astra,且 Sonnet 5.5 在 Dev Day 前一天才发布、跑分几乎追平 Opus 5.5
  • hibzy7 与 haider1 均提到 OpenAI 计划在 Dev Day(明日)一口气推出 20+ 项发布
  • 博主 kimmonismus 称 Sonnet-5.5 已对其开放使用并开始测试,暗示新模型可能处于灰度或提前开放阶段
  • X 用户 XFreeze 形容当前模型大战已到「核战」级别,称 Dario 在 Dev Day 前密集发版;其提到的 Fable 5.1 等版本名同样未经官方证实
  • Reddit 用户 Miyamoto-Musashi 称 Claude 凭 5.5 系列拉回不少已流失用户,自己是否续订 Codex 取决于 OpenAI DevDay 的表现

为什么重要

  • 若传闻属实,Anthropic 与 OpenAI 的头部竞争已进入「赶在对手发布前抢先出新」的节奏,发布时机本身成为竞争武器
  • 社区情绪高度围观:dolo937 等 Reddit 用户以 meme 表达坐等 OpenAI 明天「掏点好东西」,反映两大厂商密集对轰带来的用户决策(如订阅去留)直接受发布节奏影响
  • 后续官方公告与第三方跑分是验证这批传闻的关键

第 6 集 · Anthropic 发布 Claude Sonnet 5.5:快 30%、多数任务成本降三成(2026-09-29,58 条)

9 月 29 日,Anthropic 官方宣布推出 Claude 5.5 家族的第二款模型 Claude Sonnet 5.5,官方发布页面同步上线,有 Reddit 用户在公告前即发现该页面已悄然挂出。官方将其定位为 Opus 5.5 之外更快、更便宜的日常任务主力模型,是相对 Sonnet 5 的明确升级。速度、成本与终端基准的大幅改善使其成为中端模型市场的高性价比默认选项候选。Claude 平台与 Claude Code 均已可用。

已确认

  • 速度较 Sonnet 5 提升超过 30%,是迄今最快的 Sonnet;大多数工作任务成本最高降低 30%(定价不变但完成同样任务所需 token 大幅减少)。
  • 定价与 Sonnet 5 完全一致:输入/输出 $2/$10 每百万 token,缓存读取 $0.20。thinking 默认始终开启(adaptive 模式)。
  • Terminal-Bench 4.0 得分从 Sonnet 5 的 10.3% 跃升至 70.6%。开发者体验负责人 Lydia Hallie 称 Claude 平台侧成本最多降低 20%。
  • Anthropic 上周二为所有 Pro、Max 和 Team 用户发放了一次额度重置,尚未使用的可在 10 月 22 日前使用。
  • 同系列中另有面向高并发场景的模型;Haiku 5.5 将于未来几周加入。
  • 官方选型建议:大型项目从 Opus 起步,需要平衡质量、速度与成本的任务用 Sonnet;Claude 应用默认 medium effort,Platform API 默认 high。
  • Anthropic 将 preserved thinking 机制扩展到 Sonnet 5.5:thinking 块绑定生成它的原始组织,会话中途切换账号会触发重新读取会话,以遏制跨账号蒸馏攻击。
  • 官方发布帖附有开发指南,涵盖选型、迁移与在 Claude Code 中的使用。

官方早期实验展示

  • 官方账号在发布当日开设 Sonnet 5.5 早期实验合集线程:开发者 @repete 用 Sonnet 5 与 Sonnet 5.5 分别生成秋季落叶模拟器,直观对比两代模型的前端生成效果。
  • 开发者 @forwardeditor 用完全相同的 prompt 让两代模型分别生成弹球物理模拟,展示物理仿真能力差异。
  • 用户 @LEJlimited 给模型一张 60×46 像素的 emoji 图,要求生成可 3D 打印的模型,数小时后实物即完成打印。

员工与社区解读

  • Anthropic 员工 Addy Osmani 介绍,Sonnet 5.5 的强项是范围明确的日常任务,如修 bug、写文档、做幻灯片/表格,设计品味也不错。
  • 产品负责人 Alex Albert 表示认可,称该模型快、清晰,能力较 Sonnet 5 大幅跃升。
  • KOL kimmonismus 认为 OpenAI 被逼到墙角。

为什么重要

速度与成本双重改善叠加价格不变,意味着大量日常工程与内容类任务中 Sonnet 5.5 可能成为性价比更高的默认选择;Terminal-Bench 的跳跃式提升也显示其在终端/agent 任务上的能力变化,进一步加剧中端模型市场竞争。官方集中展示的落叶模拟器、弹球物理与 emoji 转 3D 模型等实验,则以前端生成与物理仿真的直观对比强化了升级说服力。preserved thinking 是模型厂商以工程手段遏制蒸馏攻击的代表性动作。

还有 38 条相关讨论 →

第 7 集 · Claude Sonnet 5.5 发布:智能逼近 Opus,但成 token 效率争议焦点(2026-09-29,27 条)

Anthropic 发布中端新模型 Claude Sonnet 5.5(价格为 Opus 5.5 的一半),第三方评测与实测反馈迅速铺开:智能水平逼近旗舰 Opus 5.5,但 token 消耗与成本效率成为最大争议点。整体口碑「聪明但昂贵」,是否升级取决于使用场景。

已确认

  • Artificial Analysis 实测智能指数:max 档 56 分,仅比 Opus 5.5 (max) 低 2 分;五档推理力度(max 56、xhigh 52、high 47、medium 41 等)价差 18 倍,单任务成本 $0.41 到 $7.60
  • Terminal-Bench 4.0 得分 64%,比 Sonnet 5 (max) 提升 50 个百分点
  • AA 测得 max effort 单任务平均消耗约 19.3 万输出 token,为所有已测模型最高,约为 GPT-6 Astra 的 7 倍;Reddit 用户 @Roflxd88 指其在 Intelligence Index 上累计输出 4.1 亿 token,成「最啰嗦」模型
  • @every 团队实测:比 Sonnet 5 快约 30%,多数工作场景成本最高降 30%;Dan Shipper 在其私有写作基准 Dan's Editorial Checks(7 模型 5 任务)中测得总分 65%、段落修订 90%,写作能力甚至优于 Opus 5.5
  • @Duex 自建盲测(Rust 版 DEFLATE/zlib 解压器任务):正确率追平 Opus 5.5,价格仅约四分之一
  • 评测人 Matthew Berman 早期体验称其基本达到 Opus 5.5 水平,价格便宜 50%、速度更快

尚未确认

  • @haider1(7 万粉丝 AI 从业者)实测后质疑 Sonnet 5.5「刷榜」:分数亮眼但明显更贵、更费 token,AA 指数上的成本与 token 效率甚至差于 Sonnet 5
  • Reddit 用户 @Gohab2001 质疑 Anthropic 为何发布这样定位的模型(疑似面向特定场景)

为什么重要

  • 智能指数前五名中四席被 Claude 包揽(@Hesamation 转述 AA 数据),显示 Anthropic 在模型能力上的强势地位
  • Sonnet 5.5 展示了「以 token 换智能」的路线:能力逼近旗舰但效率指标反超上代恶化,为高推理力度模式的成本定价争议提供了新案例
  • Every 团队选型建议分化:适合短轮次反馈迭代、规划类协作场景升级;Coding 场景 Kieran Klaassen 认为 Sonnet 5 仍够用;Katie Parrott 强调它更好的协作伙伴,但使用者要保持掌控、知道何时升级调用

还有 7 条相关讨论 →

第 8 集 · 多方爆料称 Claude Sonnet 5.5 跑分碾压 GPT-6 sol(2026-09-29,5 条)

9 月 29 日,多个第三方信源集中爆料 Anthropic 的 Claude Sonnet 5.5 在跑分上显著领先 OpenAI 的 GPT-6 sol,引发社区对 OpenAI 竞争力的讨论。目前所有数据均来自非官方渠道,未被任何一方正式确认。

已确认

  • X 用户 ns123abc(8.4 万粉丝)发帖并附截图,称 GPT-6 sol 在对比中被 Claude Sonnet 5.5 大幅碾压(其原话为「brutally mogged」)。
  • LuminaBench 爆料称 Claude Sonnet 5.5 在 Artificial Analysis 智能指数(Intelligence Index)上拿到 56 分,竞品模型 Sol 为 48 分。
  • 有网友爆料称 Sonnet 5.5 智能指数 56 分,仅次于 Claude Opus 5.5,高于 GPT-6 Astra。
  • 账号 AIScreening 发布第三方实测截图,显示 Sonnet 5.5 大幅领先 GPT-6 sol,且与 GPT-6 Astra 的成绩非常接近。
  • 另有引用贴称,榜单上 Claude Sonnet 5.5 Max 排名第二,超过 GPT-6 Astra Max,仅略低于 Opus-5.5;评论区认为 OpenAI 处境不利。

尚未确认

  • 所有跑分与排名均来自爆料和第三方转发,测试基准、具体题目与版本细节不明,未经 Anthropic、OpenAI 或 Artificial Analysis 官方证实。
  • m1 所述对比的具体评测方法与来源截图未公开完整信息。

为什么重要

  • 若爆料属实,意味着 Anthropic 中端定位的 Sonnet 5.5 即可压制 OpenAI 的 GPT-6 sol 并逼近 GPT-6 Astra,将直接影响两大厂商的用户选择与市场叙事。
  • 多个独立账号同日集中传播相似结论,即使数值不精确,也反映社区对 OpenAI 前沿模型相对地位下滑的担忧情绪在升温。

第 9 集 · 数据对比引争议 Sonnet 5.5 被评失败发布(2026-09-29,2 条)

Reddit 用户与博主 haider1 依据 Artificial Analysis 数据对比同价($2/$10 每百万 token)的 GPT-6 Sol 与 Claude Sonnet 5.5,发现 GPT-6 Sol 每美元得分更高,单任务成本差异明显;Sonnet 5.5 在 medium 推理档得分与定价上不占优,且输出更啰嗦,被批评为一次糟糕的发布,不过也有观点认为其上限更强。