OpenAI 释出约 400 项数学结果真相:只是内部模型压测的副产品
RexDouglass · x · 2026-10-10
研究者 deredleritt3r 澄清了 OpenAI 近期释出约 400 项数学成果的真实目的:并非要「摧毁数学研究」,而是想用最难的数学测试内部模型——结果发现除了未解的顶级难题,其他题目已不足以考验模型。这也是为什么除千禧年大奖问题外,大部分解都在单 agent、3 小时思考内完成。
这些解法是基准测试的「副产品」,但属于数学领域的真实进展,OpenAI 决定将其公开。Andrew Curran 的引用补充:多数结果并非像纳维-斯托克斯那样靠 swarm 解出,而是代号 Aeon 的内部模型单次、单 prompt 一口气完成;该模型 8 月底才出现且仍在训练,一个月前的收益曲线(对数尺度)尚未回落。4000 道题只公布了 400 项,意味着过去几天很可能又解出了更多。
「模型」频道最新
- 微软发布快速决策模型 Microsoft-Decision-1,宣称超越 LLM — MaziyarPanahi · 2026-10-10
- OpenAI 推 GPT-6 Sol/Luna:ChatGPT 智能界面实时生成可视化 — aidan_mclau · 2026-10-10
- OpenAI 研究员:新模型更诚实,但评测觉察威胁安全测量 — ericmitchellai · 2026-10-10
- 爆料称 Google 或已突破递归自我改进,三大实验室逼近 RSI — imjustnewatai · 2026-10-10
- 把「数学家」换成「医生」:AI 圈群嘲大模型数学论断的傲慢 — NachoSoto · 2026-10-10
- 用户称已逼近 Grok 每周用量上限,呼吁 xAI 翻倍额度 — nima_owji · 2026-10-10