Gemini 4 Argon tops AutomationBench-AA at 77.5%, 6 points ahead of Claude Sonnet 5.5
ArtificialAnlys · x · 2026-10-01
Artificial Analysis reports Gemini 4 Argon ranks #1 on AutomationBench-AA at 77.5%, 6 points ahead of Claude Sonnet 5.5 (max, 71.3%).
On Terminal Bench 4 it reaches 57%, a +53 point jump over Gemini 3.1 Pro Preview, but still trails Claude Sonnet 5.5 (max, 64%), Claude Opus 5.5 (max, 60%) and GPT-6 Astra (59%).
More from Models
- Gemini 4 Argon (High) Scores 1525 on Text Arena, Reshaping Pareto Frontier at $8/MToken — holynski_ · 2026-10-01
- Google's Gemini 4 Argon Comeback Applauded, but Critics Want Day-One Availability — prateeky2806 · 2026-10-01
- Gemini 4 Argon cuts token use 13% vs 3.8 Flash, at $1.99 per task lands among frontier price leaders — haider1 · 2026-10-01
- Engineer rakyll: Gemini 4 is 'pretty good,' impressed by its troubleshooting in complex setups — rakyll · 2026-10-01
- Nous Research's Hermes Desktop wows in QA demo shared online — Teknium · 2026-10-01
- Leak: Google's Gemini 4 Argon Outputs 1M Tokens Per Response, Leads GPT-6 Astra on Benchmarks — rohanpaul_ai · 2026-10-01