OpenAI 数学模型在「All the Math We Can Think Of」基准仅得 9.3%,4000 题对 372
basedjensen · x · 2026-10-07
在 OpenAI 发布内部前沿模型数学成果引发热议之际,网友实测讨论其在新基准上的成绩:「All the Math We Can Think Of Bench」4000 题中仅命中 372 题,得分 9.3%。原帖指出每题限时 3 小时可能偏低,但更想了解失败案例分布、以及哪类数学问题家族最顽强。这与官方公布的定理级成果形成有趣反差:前沿成果亮眼,但面对广义数学问题的覆盖率仍然很低。
「模型」频道最新
- 700亿参数数学模型Bel引争论:合成数据还是规模红利 — teortaxesTex · 2026-10-07
- Fable 自评新发布:相当于约 5 个「OpenAI 纳维-斯托克斯」级成果 — willdepue · 2026-10-07
- Reddit 用户发布去审查 27B 红队安全模型,自称零拒绝 — Least_Dog_8556 · 2026-10-07
- OpenAI 研究员惊讶:AI 实验室数学新成果至今没查出硬伤 — willdepue · 2026-10-07
- OpenAI 模型在 ARC 类谜题上输给 Meta 的 Muse — BLUECOW009 · 2026-10-07
- Inception 免费推出 Mercury Decide:每秒 14 次结构化决策,对标 Jev — StefanoErmon · 2026-10-07