Agent Arena 榜单:Claude Fable 5.1 居首,200 万真实会话测 agent 能力
arena · x · 2026-09-25
Agent Arena 发布基于真实世界任务的 AI agent 性能排行榜,累计超 200 万会话、覆盖 43 个模型,评测模型在长时程任务中调用网页搜索、文件系统和终端工具完成复杂工作流的能力,采用因果追踪方法衡量相对平均模型的净改进。
榜单要点:
- Claude Fable 5.1 (Max) 以净改进 13.44% 居首,任务成本中位数 $4.15
- GPT 6 Astra (Max) 净改进 11.08%,成本 $2.86,性价比领先
- Claude Opus 5 的高/Max 两档分列 3、4 位
- 开源的 Kimi K3 (Max) 进入前 9,净改进 4.56%
指标包括确认成功率、好评/差评比、可操控性、Bash 恢复能力和工具幻觉率等。
「编程与Agent」频道最新
- 拆解 Jev 决策模型:毫秒级出类型化决策,作者用 Qwen 亲手复现 — vykthur · 2026-09-25
- TinyFish 联手 Crunchbase 等 15 家公司组建 AI Agent 专属数据联盟 — rohanpaul_ai · 2026-09-25
- LLM judge 也该学金融监管:模型一换就重测判官准确率 — sh_reya · 2026-09-25
- 多智能体通信催生新基建:Agent 间的「全局总线」会是下一个原语 — madhavsinghal_ · 2026-09-25
- Greg Isenberg:Muse Connectors 或成 AI 界 App Store,数十亿美元机会 — Roger_M_Taylor · 2026-09-25
- Awesome Multi-Agent Orchestrators:多智能体编排工具精选目录上线 — Roger_M_Taylor · 2026-09-25