Argon hits 55% on FrontierSWE v2 long-horizon coding, vs ~20% for Gemini 3.x
xennygrimmato_ · x · 2026-10-01
A cited post claims Argon dramatically outpaces Gemini 3.x on long-horizon coding, jumping to 55.0% on FrontierSWE v2 versus roughly 20% for 3.7 and 3.8. The poster adds that Gemini 4 is 'extremely good' at long-horizon coding and welcomes GDM's focus on such capabilities. (Naming and figures as stated; not officially confirmed.)
More from Models
- Researcher presses for answers on benchmark evals where new models don't beat old ones — BlackHC · 2026-10-01
- Researcher jokes: don't use 'eternally confused' chatbots for nuclear crisis decisions — examachine · 2026-10-01
- Gemini 4 Argon (High) Scores 1525 on Text Arena, Reshaping Pareto Frontier at $8/MToken — holynski_ · 2026-10-01
- Researcher questions anomalous benchmark evals where new models fail to beat older ones — BlackHC · 2026-10-01
- Google's Gemini 4 Argon Comeback Applauded, but Critics Want Day-One Availability — prateeky2806 · 2026-10-01
- Gemini 4 Argon cuts token use 13% vs 3.8 Flash, at $1.99 per task lands among frontier price leaders — haider1 · 2026-10-01