Mercor 开源 APEX-1 基准,榜单排名反常引质疑

Mercor 发布并开源 APEX-1 企业任务基准,用于评估前沿模型完成「经济有价值任务」的能力。该基准覆盖投行经理、管理咨询顾问、大所律师、全科医生四类职业,由资深从业者出题并附带真实源文档。不过榜单发布后引发争议:用户 zainhas 等指出排名反常,如 GPT 5.6 Terra 高于 Astra,而 GPT 5.4 竟高于 Fable 5,令结果的可信度受到质疑。

2026-09-09 ~ 2026-09-09 · 2 条相关