Agent Arena Leaderboard: Claude Opus 5 Tops Real-World Agentic Tasks, Kimi K3 at #4
arena · x · 2026-08-21
Agent Arena ranks models on millions of real-world, long-horizon agentic tasks from a global user community, with access to web search, filesystem and terminal tools, measured via causal tracing against the average model. Current leaders: Claude Opus 5 (High) tops with 12.47% net improvement (19,787 sessions, $2.13/task), followed by Opus 5 (Max) and Claude Fable 5; Kimi K3 (Max) ranks #4 (10.41%, 83,274 sessions, only $0.63/task — standout value), with GPT 5.6 Sol (xHigh) at #5. A user-signal update shows Muse Spark 1.2 (xHigh) gained +11.4% in Bash recovery and +6% confirmed success, but -2.5% steerability.
More from Models
- Monitors Detect Significant Behavior Shift in Claude Opus — altryne · 2026-08-21
- OpenAI pauses largest training run ever as DeepSeek 'cooks again' — Fireship · 2026-08-21
- DeepSeek V4 Pro benchmarks close to Opus 5 on KernelBench-Hard — teortaxesTex · 2026-08-21
- Liquid AI releases DSpark draft models, speeding up decoding by up to 4x — JosephJacks_ · 2026-08-21
- Users report Qwen Uncensored still frequently refuses requests — BLUECOW009 · 2026-08-21
- Pander Score Leaderboard Reveals Sycophancy Differences in Major AI Models — RobbWiller · 2026-08-21