Agent Arena: Top Agent Models Differ Over 5x in Cost per Task
arena · x · 2026-08-20
Agent Arena published an agent-model value ranking based on "net improvement × cost per task" from real agentic sessions (1.87M sessions, 49 models).
- Pareto-optimal: Claude Opus 5 (High) leads at $1.78/task, +12.34%; Kimi K3 (Max) is the value dark horse at $0.62/task, +10.53%; GPT 5.5 (High) at $0.44/task, +7.75%; Grok 4.5 at $0.22/task, +6.08%; GLM 5.2 (Max) at $0.18/task, +6.06%.
- Even within the top 5, median cost per task ranges from $0.62 (Kimi K3 Max) to $3.37 (Claude Opus 5 Max) — a >5x difference.
- Claude Opus 5 (Max) costs nearly twice as much as Opus 5 (High) while scoring slightly lower (+11.97% vs +12.34%).
Related event: Agent Arena Ranking: Task Costs Vary Over 5x Among Comparable Agents(2 posts)→
More from Models
- LiquidAI releases QAD checkpoints, 4-bit models retain 97% BF16 accuracy — JosephJacks_ · 2026-08-20
- incoai releases Qwen3.8-27B-DFlash2 draft model for speculative decoding — incoai · 2026-08-20
- Superwhisper launches S1-mini, a 0.6B on-device model for transcripts — Scobleizer · 2026-08-20
- Agent Arena: Kimi K3 offers best value, Claude Opus 5 is priciest — arena · 2026-08-20
- Model 'Thinking' is Just Post-Training with Thought Sections — majidmanzarpour · 2026-08-20
- Overly Colorful Verbs: A Tell for AI Writing — dbasch · 2026-08-20