Argon hits 55% on FrontierSWE v2 long-horizon coding, vs ~20% for Gemini 3.x

xennygrimmato_ · x · 2026-10-01

A cited post claims Argon dramatically outpaces Gemini 3.x on long-horizon coding, jumping to 55.0% on FrontierSWE v2 versus roughly 20% for 3.7 and 3.8. The poster adds that Gemini 4 is 'extremely good' at long-horizon coding and welcomes GDM's focus on such capabilities. (Naming and figures as stated; not officially confirmed.)

Original post →

More from Models

Models channel →