Agent Arena 榜单:Claude Opus 5 领跑真实智能体任务
arena · x · 2026-08-21
Agent Arena 发布基于数百万真实用户长程智能体任务的排行榜,模型可调用网络搜索、文件系统与终端工具完成复杂工作流,用因果追踪方法衡量相对平均水平的表现。目前榜单头部:Claude Opus 5 (High) 以 12.47% 净提升居首(基于 19,787 会话,$2.13/任务),Claude Opus 5 (Max) 与 Claude Fable 5 紧随其后;Kimi K3 (Max) 排第 4(10.41%,83,274 会话,仅 $0.63/任务,性价比突出),GPT 5.6 Sol (xHigh) 第 5。另有一条用户信号反馈:Muse Spark 1.2 (xHigh) 的 Bash 错误恢复提升 11.4%、确认成功率提升 6%,但转向性下降 2.5%。
所属事件:Agent Arena 发布真实任务榜单,Claude Opus 5 登顶、Kimi K3 性价比领先(5 条相关)→
「模型」频道最新
- Claude Opus 5 引发反弹:评测飙升,但用户抱怨啰嗦难用 — gerardsans · 2026-08-21
- Harvey 发布法律智能模型 Tenet,专攻长周期法律任务 — rhythmrg · 2026-08-21
- Gemma 模型下载量破 10 亿,社区应用覆盖水下至太空 — osanseviero · 2026-08-21
- 吐槽:用 GPT 构建 Docker 蓝牙音频总管遭拦截 — cargsl · 2026-08-21
- Kimi K3 在复杂表格 OCR 挑战中胜出 — Aron-One · 2026-08-21
- Meta发布Muse Spark 1.2:视觉转代码、机器人导航与视听理解 — AIatMeta · 2026-08-21