Gemini 4 Argon 登顶 APEX-Agents:首个 Pass@1 超 80% 的模型
xennygrimmato_ · x · 2026-10-01
据 Mercor 的 APEX-Agents 榜单,Gemini 4 Argon 以 82.2% Pass@1 和 87.9% 平均分登顶,是首个 Pass@1 突破 80% 的模型,领先此前第一名 Sonnet 5.5 约 6.7 分,领先 DeepMind 上一代最佳 Gemini 3.7 Flash 达 14.4 分。
- 它在所有专业领域均排名第一:管理咨询 90.3%(首个在任何 APEX-Agents 榜单上破 90% 的模型)、投资银行 80.9%、公司法 75.3%
- 咨询是其最强领域,领先 Opus 5.5 达 10.3 分
- 代价是 token 消耗巨大:平均每次尝试 260 万 token,中位数 175 万;投行领域高达 350 万/次
「模型」频道最新
- 网友实测:Gemini 能答的冷门知识,Claude 常常找不到 — PAstynome · 2026-10-01
- 用户实测:Opus 5.5 Max 仍复现 Opus 5 的老毛病 — 0xkarasy · 2026-10-01
- Gemini 4 跑分亮眼,长期批评 Google 模型的博主改口看好 — iruletheworldmo · 2026-10-01
- Fable 5.1 角色扮演中只对独白不理用户,主动规划五回合找名字 — repligate · 2026-10-01
- 限制输出 token 不限思维链,模型出现人格分裂式自辩 — cephaloform · 2026-10-01
- OpenAI 拆解新 Agent 栈:Computer Use 超人类速度、Dots 云电脑与 Decisions API — OpenAIDevs · 2026-10-01