Agent Arena 榜单:Claude Opus 5 领跑真实智能体任务

arena · x · 2026-08-21

Agent Arena 发布基于数百万真实用户长程智能体任务的排行榜,模型可调用网络搜索、文件系统与终端工具完成复杂工作流,用因果追踪方法衡量相对平均水平的表现。目前榜单头部:Claude Opus 5 (High) 以 12.47% 净提升居首(基于 19,787 会话,$2.13/任务),Claude Opus 5 (Max) 与 Claude Fable 5 紧随其后;Kimi K3 (Max) 排第 4(10.41%,83,274 会话,仅 $0.63/任务,性价比突出),GPT 5.6 Sol (xHigh) 第 5。另有一条用户信号反馈:Muse Spark 1.2 (xHigh) 的 Bash 错误恢复提升 11.4%、确认成功率提升 6%,但转向性下降 2.5%。

所属事件:Agent Arena 发布真实任务榜单,Claude Opus 5 登顶、Kimi K3 性价比领先(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →