Agent Arena 榜单:200 万真实任务实测,Claude Fable 5.1 居首

arena · x · 2026-09-29

Agent Arena 发布基于真实世界任务的 AI Agent 排行榜,已累计 205 万+会话、覆盖 45 个模型。任务来自全球用户社区的长周期复杂工作流,模型可调用网页搜索、文件系统与终端工具,采用因果追踪方法衡量相对平均模型的结果改进。

榜单头部(Net Improvement):

榜单还细分工具可靠性、投诉比、Bash 恢复、工具幻觉(各家均在 0.3% 左右)等维度,Anthropic 系模型在确认成功率上整体领先。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →