研究发现大模型数学推理缺乏类人知识结构

一篇 EMNLP 论文基于知识空间理论对 8 个大模型与 1.8 万名人类学习者进行对比评估,发现 LLM 虽能答对高阶难题,却经常答不上其下层前置技能,与人类形成鲜明反差。人类学习者整体正确率 79.6%,答对的题目中 72.7% 满足知识结构一致性,而模型在数学推理中缺乏连贯的类人知识结构,现有评测指标也难以暴露这一缺陷。

2026-09-12 ~ 2026-09-12 · 2 条相关