GPT-5.6 Outperforms Sonnet on DeepSWE at Lower Cost

reach_vb · x · 2026-08-16

Benchmarks indicate GPT-5.6 Luna Max scores 13.3 points higher than Sonnet 5 Max on DeepSWE v1.1 while being 44x cheaper. DeepSWE evaluates coding agents on 113 original, long-horizon engineering tasks.

Original post →

More from Models

Models channel →