Claude Sonnet 5.5 发布:Terminal-Bench 4.0 得分从 10.3% 跃升至 70.6%
claudeai · x · 2026-09-29
Anthropic 发布 Claude Sonnet 5.5,定位为 Opus 5.5 之外更快、更便宜的日常任务主力模型,擅长范围明确的工作:修 bug、制作文档/幻灯片/表格,设计品味也不错。Haiku 5.5 将于未来几周加入。
关键数据:
- 性能:Terminal-Bench 4.0(agentic 编码评测)得分 70.6%,而 Sonnet 5 仅 10.3%;GDPval-AA(跨职业真实工作测试)仅比 Opus 5.5 低 2 分;是首个仅凭截图打通 Pokémon Red 的 Sonnet 模型,长程任务与图像理解均强。
- 价格:与 Sonnet 5 持平($2/百万输入、$10/百万输出、$0.20/百万缓存读取),但完成同样任务所需 token 大幅减少,实测每任务成本最高降 30%。
- 速度:输出生成快 30%+,是迄今最快的 Sonnet。
- 安全:自动行为审计显示对齐与诚实度在多数指标上持平或优于 Sonnet 5;是首个配备与旗舰模型同级网络安全防护与 fallback 的 Sonnet,常规软件开发不受影响。
官方称早期测试者认为它比 Sonnet 5 更适合协作,文字表达也明显更清晰。
所属事件:Anthropic 发布 Claude Sonnet 5.5:提速超 30%,成本最高降三成(25 条相关)→
「模型」频道最新
- PrivacyBench v2 发布:flow-transform 1.0 以 95.84% 登顶企业去标识化评测 — Exp_Mark · 2026-09-29
- Grok 4.7 xHigh 登顶 Artificial Analysis 网络安全指数 — XFreeze · 2026-09-29
- 开发者反复核对基准数据:新模型与 Opus 5.5 形成互补 — giansegato · 2026-09-29
- Mike Krieger 谈 Sonnet 5.5 用法,并预告 Haiku 5.5 数周内发布 — mikeyk · 2026-09-29
- 爆料称 OpenAI GPT-6 sol 被 Claude Sonnet 5.5 大幅碾压 — ns123abc · 2026-09-29
- Databricks 实测:Opus 5.5 降本 20%,GPT-6 Luna 便宜 20 倍 — pwendell · 2026-09-29