MathAdv 基准:定理证明器解原题却在等价改写上全军覆没
furongh · x · 2026-09-13
马里兰大学 Furong Huang 团队发布诊断性基准 MathAdv(arXiv:2608.25449),覆盖 13 个本硕数学领域,从四个维度评估定理证明器:Know(知识,选择题)、Reason(非形式推理,填空)、Formalize(Lean 4 形式化证明)、Generalize(专家设计的等价改写)。
核心发现:
- 脆弱性实锤:配对测试中 Goedel-Prover-V2 解出了六道原题,却在数学等价的改写版上全部失败,反向情况零次——说明脆性,虽不能直接证明记忆化;
- 形式化仍是主要瓶颈,且成绩在不同数学领域间差异巨大;
- 自然语言提示对通用 LLM 有帮助,反而会妨碍专精证明的模型;
- 聚合证明准确率掩盖了组件级评估才能暴露的能力与失效模式。
作者强调:该基准测的是模型行为,不等于结果推动了人类数学理解;对自我改进 agent 而言,「在什么上改进」需要另行检验。数据集与评估脚本已开源。
所属事件:马里兰团队发布 MathAdv 基准:定理证明器难敌等价改写(2 条相关)→
「模型」频道最新
- 爆料:某前沿实验室正向数据供应商采购现成库存数据 — geoffwolfe · 2026-09-13
- 「每周限额直接没了」:AI 服务用量限制突传大幅放宽 — haydendevs · 2026-09-13
- Mollick 又晒模型名场面:能推理剧情,却总是叫 Elara Vale — emollick · 2026-09-13
- 博主实测称 DeepSeek v4.1 Flash 前端能力超 Opus 5,逼近 Fable 5.1(未证实) — natesiggard · 2026-09-13
- 美 AI 圈争论:中国模型进步多大程度靠蒸馏美国前沿模型 — jeremiecharris · 2026-09-13
- 爆料称 Gemini 4 提前完成预训练,归功于训练中的新发现 — inductionheads · 2026-09-13