ProofAtlas 发布 LLM 评估的 500 大数学开放问题排名

RexDouglass · x · 2026-10-07

ProofAtlas 发布了按「LLM 评估重要性」排序的 Top 500 数学开放问题榜单,覆盖 17 个学科,并明确声明这是模型评估而非专家共识。排名方法:让多个大模型两两比较问题重要性,再用可靠性加权合成,模型家族权重为 OpenAI 1.00、Claude 1.00、GLM 0.95、DeepSeek 0.90。同时 LechMazur 称据 Astra 与 Opus 评估,arXiv 上存在大量错误证明,他正在实际审计,以确保这些所谓解答不影响其开放问题清单中问题的状态。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →