Agent Arena 排行榜:基于 200 万真实会话评测智能体表现
arena · x · 2026-09-29
Agent Arena 上线智能体性能排行榜,基于超过 200 万次真实会话、46 个模型,测量模型在使用网页、文件系统、终端等工具完成长周期真实任务时的净提升幅度,指标包括任务确认成功率、工具可靠性、可引导性、Bash 恢复能力和工具幻觉率。
要点
- Claude Fable 5.1 (Max) 以净提升 14.06% 位居第一,确认成功率 17.37%
- Claude Opus 5.5 (High) 排名第二(11.84%),且单任务成本中位数仅 $1.33,性价比突出
- GPT 6 Astra (Max) 排第三(10.36%),Praise vs Complaint 比例最高(33.92%)
- Anthropic 系模型占据前十中多数席位;单任务成本从约 $0.8 到 $3.47 不等
该榜单按真实任务中的工具编排能力动态排序,可作为选型 agent 模型的实用参考。
所属事件:Agent Arena 发布 200 万真实任务智能体排行榜(2 条相关)→
「模型」频道最新
- NVIDIA Nemotron 后训练综述发布:开源透明含完整训练配方 — NVIDIAAI · 2026-09-29
- 30709 投稿中 112 篇 oral:NeurIPS 论文揭 CUA 评测「回放作弊」漏洞 — proceduralia · 2026-09-29
- GPT-6 Sol 跑分出炉:ARC-AGI-2 得 89.6%,ARC-AGI-3 仅 23% — fchollet · 2026-09-29
- 开源社区整理无审查攻击性安全模型清单,含 DeepHat V2 等微调模型 — cyb3rops · 2026-09-29
- 用户实测:Claude 称单偶制与生育无道德优势,多元关系道德等同 — kevinnbass · 2026-09-29
- 手绘风动画纯靠 HTML5 Canvas 写出,作者惊叹 Opus 5.5 编码力 — Ror_Fly · 2026-09-29