Gemini 4 Argon tops APEX-Agents at 82.2% Pass@1, first model to break 80%, but burns 2.6M tokens per run
xennygrimmato_ · x · 2026-10-01
Per Mercor's APEX-Agents leaderboard, Gemini 4 Argon takes #1 with 82.2% Pass@1 and an 87.9% mean score — the first model above 80% Pass@1, +6.7 pts over prior leader Sonnet 5.5 and +14.4 pts over DeepMind's best previous model, Gemini 3.7 Flash (67.8%).
- It ranks first in every professional domain: management consulting 90.3% (first-ever 90%+ score on the board), investment banking 80.9%, corporate law 75.3%
- Consulting is its strongest domain, leading Opus 5.5 by 10.3 pts
- The cost: heavy token usage — 2.6M tokens per attempt on average (median 1.75M), with investment banking tasks hitting 3.5M per attempt
More from Models
- OpenAI's CUA leads on new agent stack: superhuman computer use, Dots cloud computers, Decisions API — OpenAIDevs · 2026-10-01
- First impressions of LMArena's anonymous Gemini 4 Argon model — FalconsArentReal · 2026-10-01
- Beff Jezos: RSI means Gemini 4 keeps improving weekly like clockwork — beffjezos · 2026-10-01
- Rumored Gemini 4 Argon to rival GPT-6 Astra, unconfirmed — sven_ai · 2026-10-01
- Reddit users call Gemini 4 Argon benchmaxxed, citing weak Terminal-Bench results — PrisonOfH0pe · 2026-10-01
- Gemini bug renders HTML tags in responses instead of showing raw code — GiangPiano · 2026-10-01