Agent Arena Launches Real-World Agent Leaderboard; Claude Fable 5.1 Tops Rankings
Agent Arena released a dynamic leaderboard based on over 2 million real agent sessions across 44 models. Claude Fable 5.1 (Max) leads with a +13.80% net improvement, GPT-6 Sol ranks 6th at 44% of rivals' cost, and DeepSeek V4.1 dominates the low-cost frontier at $0.06 per task.
2026-09-25 ~ 2026-09-26 · 4 related posts
- Agent Arena Ranks 43 Models on 2M+ Real-World Agentic Tasks; Claude Fable 5.1 Tops Board — arena · 2026-09-25
- Agent Arena leaderboard: Claude Fable 5.1 tops with +13.8% net improvement across 2M sessions — arena · 2026-09-26
- GPT-6 Sol hits #6 on Agent Arena with +7.7% net improvement at 56% less cost per task — arena · 2026-09-26
- Agent Arena Pareto frontier: DeepSeek V4.1 Flash delivers +4.1% at just $0.06 per task — arena · 2026-09-26