Agent Arena 完整榜单:Claude Fable 5.1 居首,累计评测超200万会话
arena · x · 2026-09-26
Agent Arena 发布基于真实长周期 agent 任务的动态排行榜,使用网页、文件系统、终端工具评测模型编排能力,累计 201 万+ 会话、44 个模型。
当前前列:Claude Fable 5.1 (Max) 净改进 +13.80%(成本 $4.11/任务)、GPT 6 Astra (Max) +10.85%($2.82)、Claude Opus 5 (High) +9.80%($2.15)、Claude Opus 5 (Max) +9.51%、Claude Fable 5 (High) +8.28%、GPT 6 Sol (Max) +7.68%(仅 $0.74)。榜单还包含 Confirmed Success、Steerability、Bash Recovery、Tool Hallucination 等细分信号。
所属事件:Agent Arena 榜单发布:Claude Fable 5.1 居首(4 条相关)→
「编程与Agent」频道最新
- 两个 AI agent 同处 Slack:一个修 issue,一个审代码 — Al_Grigor · 2026-09-26
- 学术 agent Memex 升级 Opus 5.5:写作质量修复,体验大好 — arjunrajlab · 2026-09-26
- LangChain 撰文:用 Jev 加 LangGraph 构建生产级 AI 系统 — LangChain · 2026-09-26
- 开发者用开源多模态模型让 AI 重新设计折叠 iPhone,一个 HTML 文件跑出完整产品概念 — alifcoder · 2026-09-26
- 决策型新模型 Jev 走红:比主流 LLM 快 200 倍、便宜 400 倍 — adnan_hashmi · 2026-09-26
- Anthropic 上线 Claude 插件目录提交门户,MCP 使用量年内涨 110 倍 — ClaudeDevs · 2026-09-26