ProofAtlas 发布 LLM 评估的 500 大数学开放问题排名
RexDouglass · x · 2026-10-07
ProofAtlas 发布了按「LLM 评估重要性」排序的 Top 500 数学开放问题榜单,覆盖 17 个学科,并明确声明这是模型评估而非专家共识。排名方法:让多个大模型两两比较问题重要性,再用可靠性加权合成,模型家族权重为 OpenAI 1.00、Claude 1.00、GLM 0.95、DeepSeek 0.90。同时 LechMazur 称据 Astra 与 Opus 评估,arXiv 上存在大量错误证明,他正在实际审计,以确保这些所谓解答不影响其开放问题清单中问题的状态。
「研究」频道最新
- 模型如何学出隐私信号:推理压力是更强的信息不对称 — kalomaze · 2026-10-07
- 数学家人手不足应对 AI 证明浪潮,人机半人马协作或成解法 — bradneuberg · 2026-10-07
- Judea Pearl 点赞《Crush Coarse》论文,称其值得读 — yudapearl · 2026-10-07
- Hermes Index 由四套基准构成,含全新自研 Hermes Bench — NousResearch · 2026-10-07
- COLM 2026 杰出论文奖揭晓,CMU 团队获奖致谢 — dan_fried · 2026-10-07
- 训练小技巧:随机化 20% 样本的 SWA 跨度,全序列损失收敛更快 — kalomaze · 2026-10-07