Epoch AI 发布 FrontierMath Erdős 基准,GPT-6 Astra 首破零分
Epoch AI 联合数学家、erdosproblems.com 创建者 Thomas Bloom(曼彻斯特大学)发布新数学基准 FrontierMath Erdős:从 2026 年 8 月仍未解决的 Erdős 问题中精选 68 道,要求 AI 系统在固定算力预算内用 Lean 形式化语言写出可自动验证的证明。陶哲轩曾在 ICM 上提及相关方向的挑战。GPT-6 Astra 成为首个解题率大于 0% 的公开模型,官方口径解出 2/68 题(得分率约 3%),其余顶级模型均未破零。
已确认
- 基准由 Epoch AI 与 Thomas Bloom 合作推出,共 68 道未解决的 Erdős 型难题,答题形式为 Lean 形式化证明,且须在固定算力预算内完成。
- 参与测试的五个顶级模型中,GPT-6 Astra 是唯一非零分者:官方口径解出 68 题中的 2 道,得分率约 3%;GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1 等其余模型均为 0 分。
- Reddit 与 DrSingularity 等多方转述的 3% 得分与官方 2/68 口径一致,进一步印证了结果。
- 另有 Reddit 用户贴出 GPT-6 Astra 在某编程 agent 指数上相对 SOL、Fable、Spark 等模型的对比图,称其显著领先且数学基准居首,但配图具体分数无法核实。
尚未确认
- 量子位报道称 Astra「独解 5 道」Erdős 难题,与 Epoch AI 官方口径 2/68 存在出入,具体数字以官方发布为准。
为什么重要
- 正如 @Jsevillamol 转述 Greg Burnham 的思路,用 Erdős 级别未解难题加 Lean 自动验证来评测 AI 数学能力,可直接检验模型能否产出人类尚未完成的形式化证明,为「AI 做出真正数学发现」提供了可量化标尺。即便最强模型仅解出 2/68,也标志着公开模型首次在该类基准上打破零分。
2026-09-04 ~ 2026-09-05 · 10 条相关
一手来源
- Epoch AI 发布 FrontierMath Erdős:GPT-6 Astra 首破 2 题 — Jsevillamol ·
- Epoch AI 发布 FrontierMath Erdős:预发布 Astra 仅解 2/68 — Chris-MelodyFirst ·
- FrontierMath 埃尔德什版发布:GPT-6 Astra 得 3%,其余模型全零 — haider1 ·
- Erdős 问题+Lean 证明实测:Astra 官方解出 2/68 — Jsevillamol · 2026-09-04
- Epoch AI 推出 FrontierMath Erdős:Astra 解出 68 道未解难题中的 2 道 — littmath · 2026-09-04
- GPT-6 Astra 编程指数大幅领先 SOL/Fable/Spark,数学重编程首选 — XCxBigDong69XCx · 2026-09-04
- GPT-6 Astra 在 FrontierMath Erdős 基准拿 3%,其余被测模型全是 0% — Every_Foundation5197 · 2026-09-05
- 曝 GPT-6 Astra 在 FrontierMath Erdős 拿 3%,其余模型全为 0 — haider1 · 2026-09-05
另有 5 条近重复转述:Jsevillamol · keviv9 · 量子位 · Chris-MelodyFirst · haider1