专题 · FULL STORY
FrontierMath Erdős:GPT-6 Astra首破纪录
Epoch AI联合数学家Thomas Bloom发布新数学基准FrontierMath Erdős,GPT-6 Astra率先打破此前的零分僵局;随后该模型又在Epoch综合能力指数上以169分刷新历史纪录,成为新基准时代的首个领跑者。
2026-09-04 ~ 2026-09-07 · 2 集 · 13 条
第 1 集 · Epoch AI 发布 FrontierMath Erdős,GPT-6 Astra 首破零分(2026-09-04,10 条)
Epoch AI 联合数学家、erdosproblems.com 创建者 Thomas Bloom(曼彻斯特大学)发布新数学基准 FrontierMath Erdős:从 2026 年 8 月仍未解决的 Erdős 问题中精选 68 道,要求 AI 系统在固定算力预算内用 Lean 形式化语言写出可自动验证的证明。陶哲轩曾在 ICM 上提及相关方向的挑战。GPT-6 Astra 成为首个解题率大于 0% 的公开模型,官方口径解出 2/68 题(得分率约 3%),其余顶级模型均未破零。
已确认
- 基准由 Epoch AI 与 Thomas Bloom 合作推出,共 68 道未解决的 Erdős 型难题,答题形式为 Lean 形式化证明,且须在固定算力预算内完成。
- 参与测试的五个顶级模型中,GPT-6 Astra 是唯一非零分者:官方口径解出 68 题中的 2 道,得分率约 3%;GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1 等其余模型均为 0 分。
- Reddit(@EveryFoundation5197)与 DrSingularity(经 @haider1 转述)等多方所称的 3% 得分与官方 2/68 口径一致,互相印证。
- 另有 Reddit 用户贴出 GPT-6 Astra 在某编程 agent 指数上相对 SOL、Fable、Spark 等模型的对比图,称其显著领先且数学基准居首,但配图具体分数无法核实。
尚未确认
- 量子位报道称 Astra「独解 5 道」Erdős 难题,与 Epoch AI 官方口径 2/68 存在出入,具体数字以官方发布为准。
为什么重要
- 正如 @Jsevillamol 转述 Greg Burnham 的思路,用 Erdős 级别未解难题加 Lean 自动验证来评测 AI 数学能力,可直接检验模型能否产出人类尚未完成的形式化证明,为「AI 做出真正数学发现」提供了可量化标尺。即便最强模型仅解出 2/68,也标志着公开模型首次在该类基准上打破零分。@EveryFoundation5197 据此展望,好奇到 2026 年底模型能达到什么水平。
- Erdős 问题+Lean 证明实测:Astra 官方解出 2/68 — Jsevillamol · 2026-09-04
- Epoch AI 推出 FrontierMath Erdős:Astra 解出 68 道未解难题中的 2 道 — littmath · 2026-09-04
- Epoch AI 发布 FrontierMath Erdős:GPT-6 Astra 首破 2 题 — Jsevillamol · 2026-09-04
- Epoch AI 发布 FrontierMath Erdős 基准,Astra 以 2/68 居首 — keviv9 · 2026-09-04
- GPT-6 Astra 独解 5 道 Erdős 难题,68 题基准仅它非零分 — 量子位 · 2026-09-04
- GPT-6 Astra 编程指数大幅领先 SOL/Fable/Spark,数学重编程首选 — XCxBigDong69XCx · 2026-09-04
- Epoch AI 发布 FrontierMath Erdős:预发布 Astra 仅解 2/68 — Chris-MelodyFirst · 2026-09-04
- GPT-6 Astra 在 FrontierMath Erdős 基准拿 3%,其余被测模型全是 0% — Every_Foundation5197 · 2026-09-05
- 曝 GPT-6 Astra 在 FrontierMath Erdős 拿 3%,其余模型全为 0 — haider1 · 2026-09-05
- FrontierMath 埃尔德什版发布:GPT-6 Astra 得 3%,其余模型全零 — haider1 · 2026-09-05
第 2 集 · GPT-6 Astra刷新Epoch能力指数纪录(2026-09-05,3 条)
Epoch AI 公布 GPT-6 Astra 在综合能力指数 ECI 上取得 169 分,较此前 163 的历史纪录跳升 6 分,超出基于早期 35 个分项的预测,并在数学、持续学习、游戏谜题等多个分项基准同时刷新纪录,FrontierMath Tier 4 达 98% 饱和。有分析认为这是推理时代以来罕见的年度能力跃升。
- GPT-6 Astra 创 Epoch 能力指数 169 纪录,数学与长程学习刷新榜 — rohanpaul_ai · 2026-09-05
- GPT-6 Astra 一举推高 Epoch 能力指数 6 分,FrontierMath Tier 4 达 98% 饱和 — eyishazyer · 2026-09-06
- GPT-6 Astra 创 Epoch AI ECI 纪录 169 分,超历史最佳 163 — burny_tech · 2026-09-07