Do LLMs Exhibit Coherent Knowledge Structures in Mathematical Reasoning? A Perspective from Knowledge Space Theory
Peng Cui, Heejin Do, Mrinmaya Sachan
EMNLP 2026 findings
cs.AI
2026-09-04
ETH用知识空间理论评8个LLM:人类72.7%答对题满足前置,最强Qwen3仅48.16%,准确率看不见。
准确率把知识当成一袋互不相关的题。二次方程式答对了就加分,一次方程和代数变形会不会,不进分母。过程评测把检查挪到推理链上,仍是逐题局部审计,看不见整张知识图上的对错是否自洽。
Knowledge Space Theory(KST,知识空间理论)是1980年代教育测量里的框架:概念之间有偏序,掌握后面的必须先掌握前面的,合法知识状态必须对前置关系闭合。ETH Zürich的Cui、Do、Sachan把这把尺子对准LLM,问两件事。模型的对错模式是否遵守人类数学课标里的前置依赖;如果不遵守,模型彼此之间有没有另一套自洽结构。
实验落在知识追踪数据集XES3G5M的英译版,去掉带图和重复题后剩4118道(填空3103、选择1015),对应18066名真实学生作答。概念表用纽约州数学课程标准:63个domain、148个cluster、480个概念,概念间前置由课标给定,平均每概念1.58个前置,推到题级后平均每题16.4个前置题。
题到概念的标注交给GPT-4.1-mini,两段式提示先选cluster再选概念,避免一次塞进480条描述。题级前置定义很严:qi是qj的前置,当且仅当qi的每一个概念都是qj某个概念的前置。故意收紧,宁可漏边也不造假边。抽400题人工核对,317题标对,准确率79.3%。
知识状态定义为答对的题集合。三条规范行为对应三个指标。
测了8个模型:Mistral-7B、Llama-3.1-8B/70B、Qwen2.5-7B/32B、Qwen3-Next-80B-A3B、Claude Sonnet 4.6、GPT-4.1-mini。开源用vLLM、温度0.6。脚手架实验k=3,五种取例(无上下文、随机、同技能、BGE-M3相似、前置),在同时能凑齐前置和同技能例题的1184道填空加233道选择上比。
全量自动标注集上,人类准确率79.6%,micro/macro PSR为0.936/0.942,72.7%的答对题PSR=1.0。Qwen2.5-32B准确率84.9%,超过人类,完美前置率只有25.44%。Qwen3-80B准确率92.5%,micro PSR 0.939略超人类,macro PSR 0.925仍低,完美前置率48.16%。Claude Sonnet 4.6和GPT-4.1-mini准确率约84%到85%,完美前置率分别是31.07%和27.97%。
| 对象 | 准确率 | micro PSR | PSR=1.0 |
| 人类 | 79.6% | 0.936 | 72.7% |
| Qwen3-80B | 92.5% | 0.939 | 48.16% |
| Qwen2.5-32B | 84.9% | 0.862 | 25.44% |
| Claude Sonnet 4.6 | 84.0% | 0.849 | 31.07% |
| GPT-4.1-mini | 85.0% | 0.862 | 27.97% |
| Mistral-7B | 21.7% | 0.299 | 8.23% |
人工核对的400题子集上结论不变。人类PSR=1.0升到81.6%,最强LLM 55.7%,缺口25.9个百分点,全量上是24.54点。核对子集每题平均前置从16.43降到7.69,闭合条件更容易满足,两边数字都涨,差距没缩。
脚手架实验里,前置例题没有特权。Qwen2.5-7B给前置上下文,SG为-0.56个百分点,比无上下文还差;Qwen2.5-32B和Qwen3-80B分别只涨0.70和0.50个百分点,同技能和语义相似例题更强,32B上前置检索只打平随机。模型吃的是解题模板,不是课标图上的前置知识。
模型之间的知识嵌套也松。人类按准确率切成低/中/高三档(0.64/0.80/0.89),弱者会的题基本被强者覆盖。开源模型彼此重叠还行,仍低于人类组间;GPT-4.1-mini和Claude互相的归一化重叠只有0.38,和开源更散。更强的模型跟人的对齐还更差。附录用GPT-4.1-mini当judge,按Relevance、Coherence、Accuracy打推理链:Llama-70B、Qwen2.5-7B、Qwen2.5-32B的Relevance分别是4.76、4.86、4.93,几乎贴在一起,对应PSR=1.0却是20.81%、27.32%、25.44%,还非单调。判分看单条推理像不像话,PSR看跨题结构,两套尺子量的不是同一个量。
给做评测和训练的人一个具体警告:准确率高、过程分也高,仍可能在知识图上到处破洞。「加法不会、乘法会」这种模式会被平均分冲掉。想分清「真会」和「背到了」,PSR这类结构指标比再刷一道GSM8K更贴。
这是评测视角,不是新架构。带概念和依赖标注的数据集公开了,能拿来审计手头在跑的模型。只覆盖数学、依赖课标图。
作者写了三条:必须有专家画好的概念依赖图,换到依赖不清晰的领域很难做;只测了数学;知识状态落在题级对错,只是潜在掌握的粗糙代理。
另外几处需要打折。概念标注准确率79.3%,纽约州课标例题325条里只对192条,排除未标的也只有72%。严格前置定义加上漏标,会少发现依赖边,作者也承认PSR=1.0的真实比例对人类和LLM都可能被高估。人类知识状态是把学生按百分位聚成三组、组内正确率过0.5才算会,和单模型一次推理不是同一种噪声。脚手架只在三个Qwen上给了SG数字,没有人类在同等in-context条件下的对照,NB2的人类基线是缺的。把开源重叠归因于训练语料重合,是事后解释,没有控制实验。
从「不满足这张课标前置图」跳到「没有真正的形式推理」,跨度偏大。更稳的说法停在:在这套课标图上,当前LLM的对错模式不像人类学习者那样闭合。