Stronger Models Take Longer on Agent Tasks

ArtificialAnlys · x · 2026-07-08

Data from Artificial Analysis indicates that stronger models tend to spend more time per task: Claude Fable 5 takes an average of 16.9 minutes/task, Claude Opus 4.8 18.5 minutes, and Claude Sonnet 5 22.8 minutes. GLM-5.2 is an exception, achieving a full pass rate comparable to Opus 4.8 in only 5.0 minutes/task. DeepSeek V4 Flash is the fastest model to reach a non-zero full pass rate, averaging 4.4 minutes.

Related event: Artificial Analysis Releases Harvey Legal Agent Benchmark Results(8 posts)→

Original post →

More from Models

Models channel →