APEX-1 榜单排名反常,GPT 5.6 Terra 竟压过 Astra 引质疑

zainhas · x · 2026-09-09

用户 zainhas 对 Mercor 的 APEX-1 企业任务基准榜单提出疑问:GPT 5.6 Terra 排名高于 Astra,而 GPT 5.4 竟高于 Fable 5、与 Gemini 3.6 Flash 持平,排名与普遍认知明显不符。该榜单评估模型在投行、咨询、律所、全科医生四类高价值职业任务上的表现。

所属事件:Mercor 开源 APEX-1 基准,榜单排名反常引质疑(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →