Agent Arena 榜单:Claude Opus 5.5 居首,GPT 6 Astra 紧随其后

arena · x · 2026-10-09

Agent Arena 发布基于真实 agentic 任务的模型排行榜,累计已收集约 238 万次会话、覆盖 52 个模型,按工具可靠性、任务完成率、可操控性等信号动态排名。

当前榜首是 Anthropic 的 Claude Opus 5.5 (High)(净提升 6 位,确认成功率 14.33%,Bash 恢复 13.55%);OpenAI 的 GPT 6 Astra (Max) 以 13.09% 排第二;Claude Fable 5.1 (Max) 排第三。榜单同时给出每任务成本、输出 token 量、工具幻觉率等指标——如 GPT 6 Sol (Max) 每任务中位成本仅 $0.58,而 Fable 5.1 高达 $6.31。Google Gemini 4 Argon (High) 排第 7,Bash 恢复能力(21.41%)在前列中最强。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →