The Gold Rush in AI4Math: Where Are We Now?
Jiashun Jin, Zheng Tracy Ke, Bingcheng Sui
stat.AP, cs.CY, cs.DL, math.HO
2026-08-25
对2026年3月至8月32944篇数学arXiv做披露审计,实质性AI使用从1.39%升到14.09%;717条具名开放问题中71%按作者自述被标成已完全解决。
能力演示已经很多。AlphaGeometry、AlphaProof、First Proof,再加上 2026 年几条公开的开放问题进展:Claude 给 Hamiltonian 圈分解找构造、未发布 OpenAI 模型给 Erdős 单位距离猜想找反例、Astra 宣称推进十个老问题。社区缺的是另一类证据:数学家到底在不在用、用在哪、用多深。能做和正在做,是两件不同的事。
这篇把窗口钉在 2026 年 3 月 1 日到 8 月 20 日,收齐主类或次类含 Mathematics 的 32944 篇 arXiv,判据是作者写在 PDF 里的披露。测到的是说出来的 AI 使用,不是真实总量。
先把 32944 份 PDF 转成文本,超过 30 万字符的只留首尾各 15 万,真正被截断的有 1007 篇。然后用 GPT-5.6 Terra(低推理力度、100 线程并行)按固定问卷打标。问卷分三块:
系统提示要求每条判断附原文摘句,并打 1 到 3 的置信度。人工校验还在做:关键词先筛出约 5000 篇候选,再抽样本填同一张表,十余人的志愿组尚未收完。现在这批数字,是 LLM 读披露,不是数学家审证明。
确认披露 AI 的有 3575 篇,其中实质性 1712 篇。占总投稿的份额涨得很快:确认使用从 3 月的 4.75% 升到 8 月 20 日前的 24.14%;实质性从 1.39% 升到 14.09%。
| 类别 | 篇数 |
| 证明构造 | 1225 |
| 形式化与验证 | 427 |
| 其他研究辅助 | 289 |
| 问题提出 | 146 |
| 语言与排版 | 2108 |
| 代码与计算 | 1229 |
语言排版仍是单类第一,但证明构造已经过千。组合论实质性 397 篇,绝对数量第一;度量几何 40/305,实质性占比 13.11%,是 31 个子领域里最高的。数论 135 篇、7.95%。数值分析和 PDE 体量大,实质性占比只有 1.91% 和 2.21%。
717 条具名开放问题记录里,510 条被标成完全解决(证真 329、证伪 181),103 条仍开着,93 条部分解决,11 条说不清。完全解决占 71%。这些标签来自作者自述,论文写得很清楚:不是独立核验。按提出年代排序的前 50 条已解决记录,从 1913 年 Ramanujan–Nagell 排到八十年代末的 Talagrand 卷积猜想,Erdős 相关条目就有 14 条。
人、机构、国家、模型都挤在少数节点上。1712 篇实质性论文对应 2764 名规范化作者、744 所大学级机构。83.6% 的作者只出现一次。加权作者计数下,美国 33.7%、中国 32.9%,两国合计约三分之二。机构篇数:MIT 35、中科大 34、Stanford 33、北大 31。作者 Gini 0.449,机构 Gini 0.606。模型侧,OpenAI 出现在 2148/3575 篇(60.08%),Anthropic 776 篇(21.71%),Google 334 篇(9.34%),DeepSeek 80 篇(2.24%)。一篇可以点名多家,比例不可加总。
给「AI 会不会改写数学」这场争论补了一张可复现的基线。窗口只有半年,实质性使用已经从可忽略涨到超过一成。组合论、数论、度量几何走得快,和近年自动推理出活最多的方向重合。如果只盯竞赛分数或个别高光反例,会低估已经发生的、按披露计的参与面。
这张表也说明早期采用有多偏。OpenAI 占六成,美中占三分之二,少数机构反复出现。讨论「数学共同体被 AI 改变了」,更准确的说法是:一小批作者和机构先改了,而且改的是他们愿意写进 PDF 的那部分。
论文自己列了四条。只测披露,未披露不可见,所以 14% 是下限不是总量。分类由 LLM 读作者措辞,会错,人工校验还没完成。机构和国家有归一化和推断,适合看分布不适合当精确排名。开放问题的「已解决」不能替代同行评审、优先权考证和正确性核验。
另外几处读下来也站不稳。问卷依赖作者怎么写「AI 帮了什么」:把 ChatGPT 改措辞和把模型写进证明主链,披露力度可以差一个数量级。3 月到 8 月的陡升,叠着模型发布、社区规范变化和 arXiv 披露政策,观测数据拆不开这三股。717 条里 71% 自称完全解决,这个比例高到需要默认打折:同题重复投稿、旧结果重述、证明有洞,都会灌进「已解决」。表 3 那种百年猜想清单,更适合当「AI 辅助数学在声称什么」的样本,不适合当「AI 已经解决了什么」的清单。