GPT-6.1 Sol 与 Claude Sonnet 5.5 重塑 Agent Arena 榜单
LMArena 本周榜单更新带来 Agent Arena 格局的显著变化:Anthropic 的 Claude Sonnet 5.5 (Max) 首秀即以 +12.5% 净提升分位列总榜第 3,而 OpenAI 的 GPT-6.1 Sol (Max) 以 +11.23% 位列第 5,并大幅拉低了前沿模型的单位成本,两者共同重塑了性能-成本 Pareto 前沿。
已确认
- Agent Arena 基于真实 Agent Mode 任务,累计 215 万+会话、覆盖 51 个模型,实时榜单与 Pareto 前沿数据由 Arena 官方公布。
- Claude Sonnet 5.5 (Max) 首秀位列总榜第 3,净提升分 +12.5%,中位单任务成本 $2.74;比排名第 13(+4.4%)的 Claude Sonnet 5 (High) 高出 8.1 个百分点,但其单任务成本比 Opus 高出 73%。
- GPT-6.1 Sol (Max) 在 OpenAI DevDay 后进入 Agent Arena,以 +11.23% 净提升位列第 5,中位单任务成本 $0.56,比 GPT-6 Sol 低 39%(另一帖给出的实时数据为 $0.57/任务)。
- Pareto 前沿上的模型还包括 Claude Fable 5.1 (Max),净提升 +14.31%、$4.62/任务。
- 本周文本榜方面,Gemini 4 Argon 登顶 Text Arena;另有帖子提及 Sonnet 5.5 以约 20% 的价格差逼近 GPT-6,四款新模型共同重塑了 Text、Code 与 Agent Arena 的 Pareto 前沿。
为什么重要
- Sonnet 5.5 性能进入第一梯队,但 $2.74 的单任务成本使其性价比明显偏低,与其在 Code Arena 对 GPT-6 的价格逼近形成对照,提示用户在性能与成本间需谨慎权衡。
- GPT-6.1 Sol 以不到四成的成本进入前五,表明前沿 Agent 能力的价格正在快速下探,Pareto 前沿的重塑可能改变企业和开发者的模型选型决策。
2026-10-03 ~ 2026-10-03 · 5 条相关
一手来源
- 【源头】Arena 周报:Gemini 4 Argon 登顶文本榜,Sonnet 5.5 以 20% 价格逼近 GPT-6 — arena · 2026-10-03
- Claude Sonnet 5.5 登 Agent Arena 第三,单任务成本高出 Opus 73% — arena · 2026-10-03
- 【源头】Agent Arena 榜单:Claude Sonnet 5.5 排第 3,单任务成本 $2.74 — arena · 2026-10-03
- GPT-6.1 Sol 登顶 Agent Arena 前五,成本比 GPT-6 Sol 低 39% — arena · 2026-10-03
- 【源头】Agent Arena 实时榜单:GPT-6.1 Sol 以 $0.57/任务进 Pareto 前沿 — arena · 2026-10-03