Mercor 开源 APEX-1 基准,榜单排名反常引质疑
Mercor 发布并开源 APEX-1 企业任务基准,用于评估前沿模型完成「经济有价值任务」的能力。该基准覆盖投行经理、管理咨询顾问、大所律师、全科医生四类职业,由资深从业者出题并附带真实源文档。不过榜单发布后引发争议:用户 zainhas 等指出排名反常,如 GPT 5.6 Terra 高于 Astra,而 GPT 5.4 竟高于 Fable 5,令结果的可信度受到质疑。
2026-09-09 ~ 2026-09-09 · 2 条相关
- APEX-1 榜单排名反常,GPT 5.6 Terra 竟压过 Astra 引质疑 — zainhas · 2026-09-09
- Mercor APEX-1 榜单:400 隐藏职业任务横评前沿模型 — zainhas · 2026-09-09