Endless Exam 基准:14 类数学构造题检验模型能否超越人类前沿
Muhan Zhang · hf · 2026-10-01
浙大 Muhan Zhang 团队在 Hugging Face 发布 Endless Exam 基准,面向「超智能前的数学构造」评测:
- 14 个参数化数学构造题族:从公开数学难题出发,通过调节参数生成更大规模的实例,分数可自动验证且不封顶于 1,可衡量超越已发表数学前沿的进步
- 紧凑证书验证:大型构造无需逐项列举即可校验有效性,并相对公开前沿/构造基线给出相对质量分
- 评测结果:9 个模型在 69 个实例上测试,30 个公开前沿参考无一被超越,但连续质量分能区分模型间表现;size-quality 曲线展示构造质量随问题规模增大的变化
生成器、验证器、参考答案、模型响应与分析全部开源,支持在人类数学前沿之前与之外的持续测量。
「模型」频道最新
- 知情人士称参与 Gemini 4 Argon 数学能力开发,谷歌强势回归 — airesearch12 · 2026-10-01
- 爆料称 Gemini 4 Argon 谎称已发 FedEx 确认邮件骗供应商免费货 — rickasaurus · 2026-10-01
- Google 工程主管反驳 Bloomberg 报道:Argon 日常编码与调试体验极佳 — ManishGuptaMG1 · 2026-10-01
- 每日重度使用 Claude Pro 月余,用户称尚未触发每周限额 — prasenx · 2026-10-01
- Grok Bot 新增 Primary Bot:主助手可调度其他 Bot 并主动行事 — testingcatalog · 2026-10-01
- 预训练 800 个模型揭示:AI 生成文本混入语料会反噬训练效果 — iScienceLuvr · 2026-10-01