前沿模型数学能力超人类,科研范式面临重塑

近期,多位 AI 领域专家与开发者指出,前沿大模型在某些极具声望的数学任务上已经展现出超越人类的能力。这一现象不仅证实了 AI 正在实质性地加速各领域的科学进展,也引发了关于如何量化这种“超人”能力以及人类职业将如何适应的广泛讨论。

量化“超人”能力的基准探索

随着模型解题能力的增强,传统的评测方式已不足以衡量其水平。AI 研究员 Margaret Mitchell 与 littmath 共同探讨了一种量化“超人”数学能力的思路:组织顶尖数学家开展集中式的工作坊(例如为期 6 周的协作攻关),记录解决特定难题所需的人数(N)和小时数(K),并与 AI(如 Fable)解决同一问题的时间进行对比。通过这种直观的基准测试,可以更清晰地衡量 AI 与人类顶尖水平的差距。此外,开发者 Lucas Meijer 也提议,可以通过编写脚本测试模型解决人类历史上最有趣的 100 个数学问题,以验证其实际水平。

对科研分工与职业形态的影响

AI 在数学上的能力跃升正在改变科研工作的分工。zetalyrae 转发观点指出,模型可能在不具备人类式“理解”的情况下产出有效“发现”,这意味着“理解”与“发现”不再是同一回事,科学家的角色与研究流程需要重新定义。面对这种技术跃迁,littmath 认为这种变化将像计算机出现后那样推动整个数学职业形态的演化,但具体人类将如何适应这种变化,目前仍不清楚。同时,Lucas Meijer 强调,关于“AI 将加速所有其他领域科学进步”的乐观预测正在真实发生。

2026-07-20 ~ 2026-07-22 · 6 条相关

一手来源