Agent Arena leaderboard: Claude Fable 5.1 tops with +13.8% net improvement across 2M sessions

arena · x · 2026-09-26

Agent Arena's dynamic leaderboard ranks 44 models on real-world, long-horizon agent tasks using web, filesystem, and terminal tools, with 2M+ sessions collected. Top of the board: Claude Fable 5.1 (Max) at +13.80% net improvement ($4.11/task), GPT 6 Astra (Max) at +10.85% ($2.82), Claude Opus 5 (High) at +9.80% ($2.15), and GPT 6 Sol (Max) at +7.68% on just $0.74/task.

The board also tracks sub-signals including Confirmed Success, Steerability, Bash Recovery, and Tool Hallucination with confidence intervals.

Related event: Agent Arena Launches Real-World Agent Leaderboard; Claude Fable 5.1 Tops Rankings(4 posts)→

Original post →

More from coding & agent

coding & agent channel →