Agent Arena Ranks 43 Models on 2M+ Real-World Agentic Tasks; Claude Fable 5.1 Tops Board

arena · x · 2026-09-25

Agent Arena launched a leaderboard measuring models on millions of real-world, long-horizon agentic tasks from a global user community, using causal tracing to compute net improvement vs. the average model. Models get web search, filesystem, and terminal tools.

Key rankings:

Metrics include confirmed success rate, praise vs. complaint, steerability, bash recovery, and tool hallucination rate.

Original post →

More from coding & agent

coding & agent channel →