EMNLP 论文:LLM 数学推理缺乏类人知识结构,评测指标看不见缺陷
rohanpaul_ai · x · 2026-09-12
arXiv 论文《Do LLMs Exhibit Coherent Knowledge Structures in Mathematical Reasoning? A Perspective from Knowledge Space Theory》(EMNLP 2026 findings),作者 Peng Cui、Heejin Do、Mrinmaya Sachan,用知识空间理论(KST)框架评估 8 个开源与闭源 LLM 并与真实人类学习者对比。
核心发现:
- LLM 不遵循人类知识结构:频繁违反知识依赖关系,且无法利用上下文中提供的相关知识提升依赖问题的表现。
- LLM 之间的知识结构不一致,知识分布重叠度低。
- 这些结构缺陷在准确率评估和 LLM-as-judge 评估中基本不可见。
结论:行为层面证明当前 LLM 的知识不具备类人结构;高准确率可能掩盖割裂的知识孤岛,评估推理模型应使用关联的简单/困难题组而非孤立 benchmark 题。
所属事件:研究发现大模型数学推理缺乏类人知识结构(2 条相关)→
「研究」频道最新
- Q2D-Web 基准发布:7 万 agent 查询评测 1.9 亿网页检索 — antoine_chaffin · 2026-09-12
- CMU 作者长文反驳 Coding is AGI:机器人任务撞墙说明世界模型不可缺 — ceciletamura · 2026-09-12
- 逆向工程还原苹果 Neural Engine 内部架构 — zdw · 2026-09-12
- SentencePiece 推出 Auto-character Coverage,替代字节级 BPE 的新方案 — prajdabre · 2026-09-12
- Hutter Prize 开放智能体群挑战,比拼终极压缩算法 — mervenoyann · 2026-09-12
- DeepMind Zahavy 用凸 MDP 论文回应「奖励非优化目标」之争 — TZahavy · 2026-09-12