GPT-6 Astra tops ongoing eval at 45; Opus 5.5 drops hard at lower effort levels

PawelHuryn · x · 2026-09-23

PawelHuryn shares interim results from his ongoing model eval: GPT-6 Astra (max) leads at 45 (n=3), ahead of Fable 5.1 (43), GPT-5.6 (42.5) and Opus 5.5 (41.7). Opus 5.5 proves very sensitive to effort level: 36 at xhigh, 31.7 at high, 30.3 at medium. Overall ordering: GPT-6 Astra > GPT-5.6 Sol ≈ Opus 5.5 > Fable 5.1 > Opus 5. Next up: Opus 5.5 low-effort runs and confirming GPT-6 Sol's anomalous 32 at max (n=1).

Related event: Bug Hunt Bench: GPT-6 Astra tops 105-bug blind benchmark, MiMo-V2.6-Pro leads on cost efficiency(16 posts)→

Original post →

More from Models

Models channel →