APEX-1 榜单排名反常,GPT 5.6 Terra 竟压过 Astra 引质疑
zainhas · x · 2026-09-09
用户 zainhas 对 Mercor 的 APEX-1 企业任务基准榜单提出疑问:GPT 5.6 Terra 排名高于 Astra,而 GPT 5.4 竟高于 Fable 5、与 Gemini 3.6 Flash 持平,排名与普遍认知明显不符。该榜单评估模型在投行、咨询、律所、全科医生四类高价值职业任务上的表现。
所属事件:Mercor 开源 APEX-1 基准,榜单排名反常引质疑(2 条相关)→
「模型」频道最新
- OpenAI 高管称 Astra 需求空前,GPT-6 用量若续涨或暂停新增 Pro 订阅 — op7418 · 2026-09-09
- 老玩家自称练出「直觉 pangram」一眼识别 AI 生成文本 — IndraVahan · 2026-09-09
- 腾讯混元发布 Gander:全双工多模态交互智能体技术报告 — Tencent-Hunyuan · 2026-09-09
- Moonshot 开源 MoBA:称 95% 注意力计算被浪费,长文本快 16 倍 — gekobraa · 2026-09-09
- 从算错 2+2 到数学博士级:一张推文概括 AI 三年进化 — haider1 · 2026-09-09
- Muse Spark 1.3 横扫 tax agent 评测:每任务 $0.32,便宜 3 倍 — zainhas · 2026-09-09