陶哲轩批评 AI 实验室刷数学 benchmark:该比拼新洞察而非新数字
Old-School8916 · reddit · 2026-09-07
陶哲轩(Terence Tao)发八连帖警告:AI 实验室竞相刷新数学 benchmark 正在伤害数学领域。
导火索:Stadlmann 于 8 月 31 日发布预印本,把素数间隔上界从 246 降到 240。几天内多家 AI 实验室在社交媒体上争相发布自己的改进。
陶的核心论点:数字本身从来不是重点。
- 从 246 到 240(甚至从 7000 万到 246)对数学其他部分帮助甚微
- 真正有价值的是过程产物:张益唐把被忽视的均匀分布工作重新启用、Maynard 发展出成为标准工具的筛法、Polymath8 展示了开放协作的力量——这些影响远超原问题
反事实推演:如果 2005 年有今天的 AI 实验室,GPY 的差一步结果会被算力碾压推到几百以内,然后无人写正式论文、无人把论证整理成可学的东西。Maynard 筛法埋死在没人读的 AI 输出里,张益唐没有高光时刻,Maynard 离开领域——上界更快改善,但数学整体受损。
这是典型的 Goodhart 定律问题。陶并非反对 AI——他引用 Erdős 问题 126 作为人机协作增进理解的正面案例——他反对的是实验室绕过专家与同行评审抢发数字。他认为 2025 年模型还无法独立解决整个问题时这种做法尚无害,到 2026 年已开始弊大于利。他的建议:改比什么——看谁能率先宣布真正新的数学洞察。
「漫话AGI」频道最新
- 研究员预测:AI 或在两年内让比特币暴跌超 50% — joshua_saxe · 2026-09-07
- Gary Marcus 吐槽:AGI 已被「实现」过几千次,黄仁勋又说了一遍 — GaryMarcus · 2026-09-07
- 多智能体对齐最大隐患:AI 或用欺诈勒索与人达成合作 — infoxiao · 2026-09-07
- AI 话语圈三大「脑虫」流派:否认派、末日派与工具主义 — mimi10v3 · 2026-09-07
- AI 安全预测正加速从「末日臆想」变成「习以为常」 — DavidSKrueger · 2026-09-07
- 开发者 Yacine:人生进步被智力挡住的远比想象少 — yacineMTB · 2026-09-07