Agent Arena 榜单:Claude 系领跑智能体任务,每任务成本差距达 9 倍
arena · x · 2026-10-06
Agent Arena 发布面向真实智能体任务的模型动态排行榜,基于超 215 万次会话、覆盖 51 个模型,评估工具可靠性、任务完成率、可操控性、Bash 恢复与工具幻觉等维度。
- Claude Fable 5.1 (Max) 以 14.31% 净提升排第一,但单任务成本高达 $5.21
- Claude Opus 5.5 (High) 排第二(13.82%),成本仅 $1.58
- GPT 6 Astra (Max) 排第四(12.27%),$3.14/任务
- GPT 6.1 Sol (Max) 性价比突出:11.23% 净提升、$0.57/任务、$2/$10 定价
- 榜单还跟踪工具幻觉率(普遍 0.5% 以下)与会话量等指标
「模型」频道最新
- Beam 首个模型开源:501B-A23B 文本 MoE,Apache 2.0 全栈放发 — brandondamos · 2026-10-06
- 开发者警告:Pangram AI 检测器不可靠,不应被当真使用 — jdjohnson · 2026-10-06
- Gemini 4 Argon 登顶 Text Arena,超第二名 Opus 4.6 达 20 分 — arena · 2026-10-06
- Arena CEO:花钱雇人做基准数据集的那一刻,评测就不再真实 — arena · 2026-10-06
- Reflection AI 首个开放权重模型正式发布 — nmasc_ · 2026-10-06
- OpenAI 在 Responses API 内置 compaction,被指或成厂商锁定手段 — pvncher · 2026-10-06