Agent Arena Leaderboard: Claude Fable 5.1 Tops Agentic Rankings Across 2.1M Sessions
arena · x · 2026-10-06
Agent Arena launched a dynamic leaderboard ranking 51 models on real-world agentic tasks, based on over 2.15 million sessions measuring tool reliability, task completion, steerability, Bash recovery, and tool hallucination.
- Claude Fable 5.1 (Max) leads with 14.31% net improvement, but at $5.21 per task
- Claude Opus 5.5 (High) ranks second (13.82%) at just $1.58/task
- GPT 6 Astra (Max) sits fourth (12.27%) at $3.14/task
- GPT 6.1 Sol (Max) stands out on value: 11.23% improvement at $0.57/task with $2/$10 pricing
- The board also tracks tool hallucination rates (generally under 0.5%) and session volume
More from Models
- Indie chatbot Auro V8 adds cross-session memory, claims self-iterating training loop — TheMoonMidas · 2026-10-06
- Dev warns: Pangram AI detector doesn't work and shouldn't be taken seriously — jdjohnson · 2026-10-06
- Reflection.ai Introduces Beam, a 501B Open-Weight Model — laurenthuberd · 2026-10-06
- Gemini 4 Argon tops Text Arena at 1525 pts, 20 pts above Claude Opus 4.6, at $8/MToken — arena · 2026-10-06
- Arena CEO: the moment you pay people to create benchmarks, they stop being real — arena · 2026-10-06
- OpenAI ships compaction in Responses API, sparking vendor lock-in debate among developers — pvncher · 2026-10-06