Agent Arena 榜单:Claude Opus 5.5 居首,GPT 6 Astra 紧随其后
arena · x · 2026-10-09
Agent Arena 发布基于真实 agentic 任务的模型排行榜,累计已收集约 238 万次会话、覆盖 52 个模型,按工具可靠性、任务完成率、可操控性等信号动态排名。
当前榜首是 Anthropic 的 Claude Opus 5.5 (High)(净提升 6 位,确认成功率 14.33%,Bash 恢复 13.55%);OpenAI 的 GPT 6 Astra (Max) 以 13.09% 排第二;Claude Fable 5.1 (Max) 排第三。榜单同时给出每任务成本、输出 token 量、工具幻觉率等指标——如 GPT 6 Sol (Max) 每任务中位成本仅 $0.58,而 Fable 5.1 高达 $6.31。Google Gemini 4 Argon (High) 排第 7,Bash 恢复能力(21.41%)在前列中最强。
「编程与Agent」频道最新
- Grok Bot 能力全清单:收邮件、管日历、建店铺、协调多智能体 — XFreeze · 2026-10-09
- 开源 huashu-art-motion:35 种艺术风格让画动起来,单条动画报价数百到千元 — AlchainHust · 2026-10-09
- 「学会营销工程就不再失业」:只需 Claude Code 和 GitHub 账号 — FinanceYF5 · 2026-10-09
- 开源 49 个免费 Claude 营销 Skills,覆盖 Google/Meta 广告与 SEO — FinanceYF5 · 2026-10-09
- 「营销工程」全套练习:用 Claude Code 和 GitHub 搭 11 个营销 Agent — FinanceYF5 · 2026-10-09
- 不会写代码的花叔靠 AI 在 GitHub 收获 10 万+ stars — AlchainHust · 2026-10-09