Agent Arena 榜单:Claude Sonnet 5.5 排第 3,单任务成本 $2.74
arena · x · 2026-10-03
Agent Arena(基于真实 Agent Mode 任务、215 万次会话的 Agent 排行榜)公布 Claude Sonnet 5.5 登上总榜第 3:中位单任务成本 $2.74,净改进分 +12.5%。它性能属第一梯队,但性价比不如同门的 Claude Opus 5.5——后者每任务仅 $1.58、净改进 +13.8%,因此 Sonnet 5.5 略微偏离 Pareto 前沿。
当前 Pareto 前沿模型包括:Claude Fable 5.1 (Max,+14.31%/$4.62)、Claude Opus 5.5 (High,+13.82%/$1.58)、GPT 6.1 Sol (Max,+11.23%/$0.57)、DeepSeek V4.1 Flash (+4.02%/$0.10)、小米 MiMo V2.6 Pro/Flash 等。榜单前 10 还有 GPT 6 Astra、Gemini 4 Argon、Kimi K3 等,可按成本与得分两个维度筛选查看实时结果。
所属事件:GPT-6.1 Sol 与 Claude Sonnet 5.5 重塑 Agent Arena 榜单(5 条相关)→
「模型」频道最新
- 资深工程师:AI 编码质量已超人类,Opus 比我遇过的工程师都强 — facontidavide · 2026-10-03
- 用户吐槽 Grok 套餐无升级入口:付费订阅也未必能提升 Bot 额度 — JOBhakdi · 2026-10-03
- Vercel 发布 Python 版 AI SDK,实验性 evaluate() API 直连 Jev — cramforce · 2026-10-03
- ChatGPT Pro 用户控诉:周额度被提前强制重置作废 — Garbia · 2026-10-03
- 开发者自建 AtlasBench 空间推理基准,GPT-6.1 登顶 84.7% — flowersslop · 2026-10-03
- 用户实测:手机被强切 Gemini 后几乎啥都干不了 — loonydan42 · 2026-10-03