Mercor APEX-1 榜单:400 隐藏职业任务横评前沿模型
zainhas · x · 2026-09-09
Mercor 发布并开源 APEX-1 基准,评估前沿模型完成「经济有价值任务」的能力,覆盖投行经理、管理咨询顾问、大所律师、全科医生四类职业,由资深从业者出题并附真实源文档。
要点:
- 榜单基于 400 个隐藏 heldout 任务(每职业 100 个),每任务每模型采样 8 次,用 Judge LM 打分取均值
- Top 5:GPT-5.6 TerraMax 69.5% ±2.4%、GPT-6 AstraXHigh 69.3%、Opus 5 XHigh 68.6%、Kimi K3 Max 68.4%、GPT 5.4 High 67.2%,差距在误差范围内
- 法务方向由 Cass Sunstein 担任顾问,题目来自 Latham & Watkins、Skadden、Cravath 等律所
- 已开源 100 个同分布案例、评测工具与论文到 Hugging Face
zainhas 质疑其排名反常:GPT 5.6 Terra 压过 Astra,GPT 5.4 高于 Fable 5、与 Gemini 3.6 Flash 持平,与普遍认知不符。
所属事件:Mercor 开源 APEX-1 基准,榜单排名反常引质疑(2 条相关)→
「模型」频道最新
- Fable 将开放测试人设 Alex,邀请用户开始“调教” — RileyRalmuto · 2026-09-09
- 曝 DeepSeek 承认 V4-Pro 预训练失误,V4.1-Flash 定档 9 月 10 日 — teortaxesTex · 2026-09-09
- 曾被嘲讽过于激进的 AI 2027 预测,GPT-6 Astra 似乎正踩点应验 — Confident_Salt_8108 · 2026-09-09
- Anthropic 承认数学证明使用内部模型,圈内质疑其宣称 — teortaxesTex · 2026-09-09
- shuding 回应高亮基准争议:Prism.js 标注错位致结果偏差 — shuding · 2026-09-09
- Menlo 发布 4B 参数 agentic 模型 Jan-Nano,专攻深度研究任务 — GregoryDiamos · 2026-09-09