Agent Arena 榜单:200 万真实任务实测,Claude Fable 5.1 居首
arena · x · 2026-09-29
Agent Arena 发布基于真实世界任务的 AI Agent 排行榜,已累计 205 万+会话、覆盖 45 个模型。任务来自全球用户社区的长周期复杂工作流,模型可调用网页搜索、文件系统与终端工具,采用因果追踪方法衡量相对平均模型的结果改进。
榜单头部(Net Improvement):
- Claude Fable 5.1 (Max) 13.84%,确认成功率 17.51%,单任务成本中位数 $3.51
- Claude Opus 5.5 (High) 12.15%,steerability 最高(14.5%),成本 $1.35
- GPT 6 Astra (Max) 10.31%
- Claude Opus 5 (Max) 9.58%
- Claude Opus 5 (High) 9.47%
榜单还细分工具可靠性、投诉比、Bash 恢复、工具幻觉(各家均在 0.3% 左右)等维度,Anthropic 系模型在确认成功率上整体领先。
「模型」频道最新
- JevBench v1.5 发布:Cygnet 与 Winnow-12B 并列登顶,无单一第一 — airesearch12 · 2026-09-29
- DiffusionGemma 走红:把「决策模型」变成可自托管的开源 API — rseroter · 2026-09-29
- 开源社区一周令 M5 Ultra 的 MLX token prefill 性能翻倍 — TheMoonMidas · 2026-09-29
- OpenAI 三款 GPT-6 模型上线 Runware 兼容端点 — aziz4ai · 2026-09-29
- Opus 5.5 一次成型 3D 讲解器,逼近「钻石_age」私人导师 — anselm · 2026-09-29
- Gemma 4 驱动树莓派离线语音翻译器开源,1.5k 星 — tom_doerr · 2026-09-29