OpenAI 数学模型在「All the Math We Can Think Of」基准仅得 9.3%,4000 题对 372

basedjensen · x · 2026-10-07

在 OpenAI 发布内部前沿模型数学成果引发热议之际,网友实测讨论其在新基准上的成绩:「All the Math We Can Think Of Bench」4000 题中仅命中 372 题,得分 9.3%。原帖指出每题限时 3 小时可能偏低,但更想了解失败案例分布、以及哪类数学问题家族最顽强。这与官方公布的定理级成果形成有趣反差:前沿成果亮眼,但面对广义数学问题的覆盖率仍然很低。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →