Anthropic 发布 Claude Sonnet 5.5:半价贴平 Opus 5.5,Terminal-Bench 从 10.3% 飙至 70.6%
AGI Hunt · wechat · 2026-09-29
距离 Opus 5.5 发布仅一周,Anthropic 推出 Claude Sonnet 5.5,定位为更快更便宜的搭档模型:价格与 Sonnet 5 持平(输入 $2/输出 $10 每百万 token),速度提升 30% 以上,同任务 token 成本最多降低 30%。
跑分亮点
- Terminal-Bench 4.0:Sonnet 5 仅 10.3%,Sonnet 5.5 达 70.6%,反超 Opus 5.5 的 66.4%;
- Chartography 从 15.6% 涨到 61.6%;GDPval-AA 得分 1844,仅比 Opus 5.5 低 2 分;
- 同价位的 GPT-6 Sol 在多数项目上明显落后。
Effort 档位
官方称 Low/Medium 档即可用约十分之一的成本超过 Sonnet 5 满配:AA-Briefcase 上 Sonnet 5 满配每任务约 $14、Elo 1360,而 Sonnet 5.5 Medium 每任务约 $1.6、Elo 1460。有个插曲:FrontierCode 上开 Max(52.1%→46.2%)反而降分,因为模型爱拆 subagent 做 code-review,导致超时或改了任务范围外的代码被扣分。
客户反馈:Balyasny 金融任务 token 用量从 49.7 万降至 12.1 万;Box 快 2.4 倍;Atlassian 最多快 30%。设计能力也有升级(沙丘 demo),还是第一个仅靠截图通关《宝可梦红》的 Sonnet。
安全与可用性:首个配备网络安全防护、防蒸馏分类器和 preserved thinking 的 Sonnet;高风险网络安全任务回退给 Sonnet 5。已上线 Claude 应用、Claude Code 及三大云 API,支持零数据保留。Haiku 5.5 将于未来几周发布。
所属事件:Anthropic 发布 Claude Sonnet 5.5:提速超 30% 成本降三成(40 条相关)→
「模型」频道最新
- Every 实测 Sonnet 5.5:修复 Claude Code bug,快 30% 且用量省 30% — every · 2026-09-29
- AMD 拟以约 82 亿美元股票收购李飞飞 World Labs,李飞飞出任首席科学家 — rohanpaul_ai · 2026-09-29
- 黄仁勋回应蒸馏争议:这叫竞争,随便测别人的产品 — kevinsxu · 2026-09-29
- 前沿模型节奏放缓:更便宜更稳,但能力不再跃升 — zsakib_ · 2026-09-29
- Claude 用量额度从「几乎没法用」放宽到近乎无限 — every · 2026-09-29
- 重磅预告:无需反向传播,零阶优化直接预训练 Transformer — teortaxesTex · 2026-09-29