GPT-6 Astra 登顶 Mercor APEX-Agents 榜,专业服务任务均值 62.4%
sherwinwu · x · 2026-09-04
Mercor 的 APEX-Agents 榜单(评测模型完成投行分析师、咨询顾问、公司律师等长周期专业任务)公布新结果:GPT-6 Astra 首次登顶,平均分 62.4% 排名第一,Pass@1 46.7% 排第二,比 Claude Fable 5.1 平均分高 0.4 分、Pass@1 低 0.8 分。
要点:
- 相比上代 GPT-5.6 Sol,Astra 排名上升 6 位,平均分提升 5.7 分、Pass@1 提升 6.7 分;三个职业领域均提升至少 4.5 分,是全面进步而非单点拉动
- 基准包含 33 个模拟工作世界、480 个任务与评分细则,数据集及执行评测基建 Archipelago 全部开源
- 律师类任务上 Astra 得分 67.9%
APEX-Agents 由行业专家构建数据丰富的模拟项目场景,再设计真实任务,让模型使用与人类相同的软件完成。
「模型」频道最新
- OpenAI 为 GPT-6 Astra 上线失准监控,官方承认监测或有遗漏 — ShakeelHashim · 2026-09-04
- Databricks 评测:GPT-6 Astra 登顶 OfficeQA Pro 数据推理新 SOTA — downingARK · 2026-09-04
- 数学家实测 GPT-6 Astra:边写论证边在 Lean 里实时验证证明 — teortaxesTex · 2026-09-04
- Tavus 发布 Sparrow-2:主打轮次检测与打断处理的对话理解模型 — ycombinator · 2026-09-04
- ARC-AGI-3 实测:max 推理多花 10 倍 token,总成本反降三成 — i_dg23 · 2026-09-04
- 研究者指 OpenAI Astra 系统卡存在数学基准数据污染疑点 — dfrsrchtwts · 2026-09-04