FrontierMath 两年被刷穿 AI 数学能力再超预期
Afinetheorem 发文指出,两年前数学家还认为极难的 FrontierMath 基准,如今 Tier 3 已被 AI 饱和,新 GPT 更满分通过更难的 Tier 4,开放难题已解出 9/49,显示 AI 数学能力进步远超预期。作者同时承认瓶颈真实存在,但认为若把数学领域展现的进步速度哪怕打一折推广到生物学、制药、住宅建造等领域,将带来巨大收益;若不实现,将是「史上最大的反进步失误」。
2026-10-03 ~ 2026-10-03 · 2 条相关
- FrontierMath 两年被刷穿:新 GPT 满分通过 Tier 4,开放难题已解 9/49 — Afinetheorem · 2026-10-03
- AI 进步速度若惠及生物与能源,不实现就是「史上最大反进步失误」 — Afinetheorem · 2026-10-03