Agent Arena leaderboard: 2M+ real-world agentic tasks rank Claude Fable 5.1 on top

arena · x · 2026-09-29

Agent Arena launched a leaderboard measuring models on millions of real-world, long-horizon agentic tasks — 2,058,478 sessions across 45 models — where models use web search, filesystem, and terminal tools, scored via causal tracing of outcomes relative to the average model.

Top of the board (Net Improvement):

Sub-metrics include tool reliability, praise vs complaint, Bash recovery, and tool hallucination (all labs around 0.3%), with Anthropic models leading on confirmed success rates.

Original post →

More from Models

Models channel →