Claude Sonnet 5.5 登 Agent Arena 第三,单任务成本高出 Opus 73%
arena · x · 2026-10-03
Claude Sonnet 5.5 (Max) 在 Agent Arena 首秀位列 #3,净提升分 +12.5%,较排名第 13(+4.4%)的 Claude Sonnet 5 (High) 高出 8.1 个百分点。
分类成绩上,Sonnet 5.5 在 Chat 类拿到 #1(+15.6%),超过 Fable 5.1(+11.49%)和 Opus 5.5(+10.29%)。
但性能领先的代价是价格:其中位单任务成本 $2.74,比排名第 2 的 Claude Opus 5.5 (High)($1.58)高出约 73%,而后者分数更高——这一性价比权衡使 Sonnet 5.5 未能进入 Agent Arena 的 Pareto 前沿。目前 Anthropic 模型包揽该榜前三。
所属事件:GPT-6.1 Sol 与 Claude Sonnet 5.5 重塑 Agent Arena 榜单(5 条相关)→
「模型」频道最新
- 资深工程师:AI 编码质量已超人类,Opus 比我遇过的工程师都强 — facontidavide · 2026-10-03
- 用户吐槽 Grok 套餐无升级入口:付费订阅也未必能提升 Bot 额度 — JOBhakdi · 2026-10-03
- Vercel 发布 Python 版 AI SDK,实验性 evaluate() API 直连 Jev — cramforce · 2026-10-03
- ChatGPT Pro 用户控诉:周额度被提前强制重置作废 — Garbia · 2026-10-03
- 开发者自建 AtlasBench 空间推理基准,GPT-6.1 登顶 84.7% — flowersslop · 2026-10-03
- 用户实测:手机被强切 Gemini 后几乎啥都干不了 — loonydan42 · 2026-10-03