前沿模型数学能力被指超越人类,专家探讨量化基准

近期,多位 AI 领域专家与开发者指出,前沿大模型在某些极具声望的数学任务上已经展现出超越人类的能力。这一现象不仅证实了 AI 正在实质性地加速各领域的科学进展,也引发了关于如何量化这种“超人”能力以及人类职业将如何适应的广泛讨论。

量化“超人”能力的基准探索

随着模型解题能力的增强,传统的评测方式已不足以衡量其水平。AI 研究员 Margaret Mitchell 与 littmath 共同探讨了一种量化“超人”数学能力的思路:组织顶尖数学家开展集中式的工作坊(例如为期 6 周的协作攻关),记录解决特定难题所需的人数(N)和小时数(K),并与 AI(如 Fable)解决同一问题的时间进行对比。通过这种直观的基准测试,可以更清晰地衡量 AI 与人类顶尖水平的差距。

对科研与职业形态的影响

开发者 Lucas Meijer 认为,关于“AI 将加速所有其他领域科学进步”的乐观预测正在真实发生。面对这种技术跃迁,littmath 认为这种变化将像计算机出现后那样推动整个数学职业形态的演化,但具体人类将如何适应这种变化,目前仍不清楚。

2026-07-20 ~ 2026-07-21 · 5 条相关