OpenAI 发布 722 篇数学论文,平均 3 小时算力攻多个百年难题
Latent Space · rss · 2026-10-07
OpenAI 发布 722 篇数学论文稿,称解出 500 大开放难题中的 90 个
OpenAI 公开内部前沿模型产出的 722 篇数学手稿(372 组相关结果),评估自约 4000 个研究问题,平均每个结果仅用约 3 小时 ChatGPT Pro 思考取力。模型本身未发布,但附论文、证明工件与部分推理摘要;Altman 称之为「发现的新时代」。
- 亮点结果(均未经独立验证):准黎曼假设(被称为「200 年来数论最大成果」)、快于 n log n 的整数乘法、1994 年以来悬而未决的 3D 弹性反问题唯一性,以及对 Riemann/Hodge/BSD 的部分进展。此前 Navier-Stokes 模型曾以 88 小时、1 万个 agent 完成。数学家 Levent Alpöge 称之为「数学史上最重要时刻」,但也提到涉及其他实验室用户的抢发与利益冲突问题。
- 质疑:Will Depue 预计部分结果经不起检验,并建了 citedbyagi.com 追踪引用;分析称约 20% 结果是否证/反例,反驳「AI 数学=暴力搜索」;Chollet 追问 RLVR 友好领域的能力能否泛化到不可验证领域。
Mistral Large 4「Le Chonk」发布:1T 总参/49B 激活,原生多模态,欧洲约 3800 张 GB300 训练,API 定价 $1.36/$4.18 每百万 token,权重月底开源。Mistral 称人类评测胜 GLM 5.3(STEM/CAD/金融),盲测编码第二仅次 Opus 5;AA 指数 38,与 GPT-6 Luna 持平,但成本为同级开源模型 4 倍以上;Cline 指其网络能力领先部分源于拒绝率低。
其他发布:Google EmbeddingGemma 2 首个原生多模态开源嵌入模型(Apache 2.0,270M–740M 多变体);Nano Banana 2.1 图像模型降价至 $0.034/张;「决策模型」成新品类——OpenAI Decisions API 公测(号称快 10 倍)、Perplexity 开源 pplx-decider;Ling 3.1 Flash(560B/25B 激活,AA 指数 41)。
「模型」频道最新
- Mistral Large 4 网安基准反超 Opus 5.5 与 GPT-6,全因拒绝率更低 — burny_tech · 2026-10-07
- 独立模型 Auro 发布 V9:对战 V9 胜率约 10:1 压制 V8 — TheMoonMidas · 2026-10-07
- _xjdr 点名四大值得关注的开源权重模型 — _xjdr · 2026-10-07
- 研究员 _xjdr 力挺 inkling 架构:与 DSV4 同列新晋最爱 — _xjdr · 2026-10-07
- 开发者实测 OpenAI Decisions API:超 65% 请求需回退,误判雕像为人脸 — taufiqintech · 2026-10-07
- X 平台已下线 @grok 提问功能,用户仍在惯性艾特 — BLUECOW009 · 2026-10-07