Agent Arena Leaderboard: Claude Opus 5 Tops Real-World Agentic Tasks, Kimi K3 at #4

arena · x · 2026-08-21

Agent Arena ranks models on millions of real-world, long-horizon agentic tasks from a global user community, with access to web search, filesystem and terminal tools, measured via causal tracing against the average model. Current leaders: Claude Opus 5 (High) tops with 12.47% net improvement (19,787 sessions, $2.13/task), followed by Opus 5 (Max) and Claude Fable 5; Kimi K3 (Max) ranks #4 (10.41%, 83,274 sessions, only $0.63/task — standout value), with GPT 5.6 Sol (xHigh) at #5. A user-signal update shows Muse Spark 1.2 (xHigh) gained +11.4% in Bash recovery and +6% confirmed success, but -2.5% steerability.

Related event: Agent Arena Launches Real-Task Leaderboard: Claude Opus 5 Tops, Kimi K3 Leads Value(5 posts)→

Original post →

More from Models

Models channel →