APEX-Agents 1.1 更新基准:Claude Fable 5.1 以 68.6% 居首
amaarora · x · 2026-09-09
- Mercor 发布 APEX-Agents 1.1,随模型能力演进更新任务规范、工具与环境,以维持排行榜准确性。
- 最重要的变化:不再奖励含糊其辞、不给出明确结论的答案,让评分方式对齐专业人员的实际工作方式。
- Pass@1 最新排名:Claude Fable 5.1 以 68.6% 居首,Gemini 3.7 Flash 67.8%、Claude Opus 5 65.8%、Grok 4.6 65.3%、GPT-6 Astra 64.7%。
- Ryan Marten 点评称用 GEPA 来优化 judge(agentic verifier)的思路很好,该基准也已上架 Harbor Hub。
「模型」频道最新
- 网友实测 Muse 打电话还说克罗地亚语,官方却称不支持通话 — nathanbenaich · 2026-09-09
- DeepSeek V4.1 Flash 盲测登国产第一,换客户端暴跌近 17 分 — teortaxesTex · 2026-09-09
- Astra 备战新加坡 F1 夜赛,OpenAI 现场直播演示 — gabrielchua · 2026-09-09
- Nex-N2.5 免费登陆 OpenRouter:262K 上下文的视觉反馈环智能体编码模型 — airesearch12 · 2026-09-09
- Raschka 长文拆解 GPT-6 Astra:循环深度、隐藏推理与 Looped Transformer — bibryam · 2026-09-09
- 社区把 MiniMax H3 从 28 步加速到 6 步,登顶加速竞技场 — AdinaYakup · 2026-09-09