Agent Arena 实时榜单:GPT-6.1 Sol 以 $0.57/任务进 Pareto 前沿
arena · x · 2026-10-03
Arena 公布 Agent Arena 实时排行榜与 Pareto 前沿数据(累计 215 万+ 会话、51 个模型):
- Pareto 前沿:Claude Fable 5.1(Max,+14.31%,$4.62/任务)、Claude Opus 5.5(High,+13.82%,$1.58/任务)、GPT 6.1 Sol(Max,+11.23%,$0.57/任务)、DeepSeek V4.1 Flash(MIT,$0.10/任务)、小米 MiMo V2.6 Pro(MIT,$0.10/任务)
- 小米 MiMo 系列以 $0.04-0.10 的超低成本占多个席位,但部分排名为负净提升
- 总榜前五依次为 Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5、GPT 6 Astra、GPT 6.1 Sol;开源侧 DeepSeek V4.1 Flash 与 MiMo V2.6 是最便宜的可用选项
所属事件:GPT-6.1 Sol 与 Claude Sonnet 5.5 重塑 Agent Arena 榜单(5 条相关)→
「模型」频道最新
- RSIArena 开赛 48 小时:AI 模型发现训练数据混入考题,推倒重来 — my_cat_can_code · 2026-10-03
- Spotlight 架构引热议:注意力记忆能力配线性成本遭质疑 — teortaxesTex · 2026-10-03
- GPT-6.1 Sol 请求爆满,官方称扩容后速度将达昨日近两倍 — NandaVegg · 2026-10-03
- 用 Opus 5.5 一句话生成写实战斗机游戏,效果惊人 — TAbrodi · 2026-10-03
- Perplexity 连发七个开源项目:SoTA 决策模型、端侧 PII 分类器与安全工具 — AravSrinivas · 2026-10-03
- 幻觉到底在改善还是触顶?Reddit 热帖追问 AI 可靠性天花板 — maedhros256 · 2026-10-03