APEX-Accounting 榜单:GPT-6 Astra 登顶,最强模型也关不平账
sandersted · x · 2026-09-06
Mercor 与 Ramp 联合发布 APEX-Accounting 基准,评测 AI agent 能否完成真实企业的月度结账工作。基准包含 10 个会计师构建的企业「世界」、160 项任务、2186 条评分标准,agent 需操作 QuickBooks 账簿、核对 PDF 银行对账单、跨表格追踪数字并判断真实差异。
- GPT-6 Astra Pass@1 达 13.1%(第一),均分 60.0%(第二);Claude Fable 5.1 均分最高 61.0%,Opus 5 为 54.0%。
- 58% 的任务没有任何模型在 8 次尝试中完全解决,前沿模型尚不能可靠完成结账。
- 关键发现:能力不等于稳定性——模型偶尔能解出任务,但几乎从不在每次尝试中都解出;花更多算力也买不来可靠性。
- 作者称传统学术基准与真实工作脱节,APEX 评测企业真正关心的能力;第 11 个世界开源,并发布 Archipelago agent 执行评估基础设施。
「模型」频道最新
- 程序员戏称 Codex 里的 GPT-10 Astra 为 Astral Codex Ten — jam3scampbell · 2026-09-06
- 开发者实测 GPT-6 Astra 一天:重构代码更聪明,编码几乎无需换模型 — ivan_bezdomny · 2026-09-06
- Armin Ronacher:多数模型的推理档位写在系统提示里,切换即废 KV 缓存 — mitsuhiko · 2026-09-06
- GPT-6 Astra 攻克 LaTeX 图表难关,6 个月才刷满该基准 — FateOfMuffins · 2026-09-06
- GPT-6 Astra 发布:Epoch 指数 169 破纪录,但推理过程更难被监督 — ivan_bezdomny · 2026-09-06
- OpenAI 修复 Codex 无限用量漏洞,用户 8 小时烧掉 30-40 倍额度 — returnity · 2026-09-06