新研究诊断LLM数学短板:发现能力是最大瓶颈,可定向修复
TexasAMUniversity · hf · 2026-10-06
德州农工大学团队系统研究 LLM 是否真正具备支撑解题的结构性数学理解:
- 数学原语与基准:提出「数学原语」(Mathematical Primitive)概念和新基准,从发现(Discovery)、生成(Generation)、消化(Digestion)、执行(Execution)四个维度探测结构性数学理解。
- 诊断结论:解题准确率掩盖了不同的能力画像;原语能解锁大量潜在的执行能力;发现能力是数学推理的主导瓶颈。
- 修复方法:基于这些发现提出原语特权的自蒸馏框架,选择性地把原语引导的推理迁移给学生模型,在多个模型规模与高难基准上持续优于基线,且发现受限的失败尤其容易被修复。
「研究」频道最新
- 处理边界慢轨道:子采样+外推修正,保证 Mandelbrot 面积估计无偏 — geoffreyirving · 2026-10-06
- 与 2025 年 Hsing Lo 估计差 6.5e-9,作者复现检验后判断为涨落所致 — geoffreyirving · 2026-10-06
- Claude 分析+优化 CUDA 算出 Mandelbrot 集面积,精度较 2012 年纪录提升 60 倍 — geoffreyirving · 2026-10-06
- 群体进化智能体 GEA:以群体而非单个 agent 为进化单元的新范式 — xwang_lk · 2026-10-06
- COLM 论文 SLIM:面向长程任务的智能体搜索框架 — xiye_nlp · 2026-10-06
- 光遗传学诺奖之争:被遗忘的真正发明人潘卓华 — _onionesque · 2026-10-06