AdvancedMathBench:高阶数学证明基准
internlm · hf · 2026-07-14
作者提出 AdvancedMathBench,用于评估大模型在高阶数学证明生成与验证上的能力。现有数学基准主要停留在高中/竞赛题,且往往只看最终答案,难以衡量证明过程是否真的有效,因此这个基准试图补齐“高阶数学推理”和“证明验证”两块。
基准组成
- ProverBench:296 道题,覆盖本科到博士资格考试级别
- VerifierBench:888 条模型生成的证明轨迹,配有人类专家真值,用来评估模型能否判断证明是否成立并给出合理解释
- 还构建了一个基于大规模专家标注训练的自动验证管线,可输出正确性判断和细粒度错误分析,并且与人类专家在留出集上有较强一致性
结果
实验显示该基准对前沿模型仍然很难:
- 最佳模型在证明生成上,UGD 和 QE 切分分别只有 75.8 和 66.1
- 证明验证上最佳 Balanced F1 只有 65.1
- 模型整体的 true negative rate 偏低,说明“识别错误证明”仍然是明显瓶颈
「研究」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11