8 个 LLM 与 1.8 万人对比:模型会做难题却常缺失基础知识结构
rohanpaul_ai · x · 2026-09-12
基于知识空间理论(KST)的评估发现,LLM 能答对高阶问题,却经常答不上其下层前置技能,与人类学习者形成鲜明反差。
- 人类学习者整体正确率 79.6%,答对的题中 72.7% 同时答对了全部被测前置技能;Qwen3-80B-Instruct 正确率高达 92.5%,但只有 48.16% 的正确答案具备完整前置知识一致性。
- 前置示例并不比同技能或相似示例更能提升表现;标准 reasoning judge 也基本察觉不到这种结构缺陷。
- 结论:高准确率可能掩盖彼此割裂的知识孤岛,建议用「简单+困难」关联题组而非孤立 benchmark 题来评估推理模型。
所属事件:研究发现大模型数学推理缺乏类人知识结构(2 条相关)→
「研究」频道最新
- 菲尔兹奖得主联名发表公开信,谈 AI 与数学的未来 — poigre · 2026-09-12
- 1.9万人实验:AI说服力胜过世界冠军辩手,筹资效果达人类3倍 — ben_j_todd · 2026-09-12
- 把 token 局部交互计算从推理挪进训练,被视为规模化优化新蓝图 — AccBalanced · 2026-09-12
- 开源方案实现零训练-推理失配的大 MoE 模型 RL 训练 — kastnerkyle · 2026-09-12
- ICLR 2026 论文 MoM:混合多记忆状态破解线性模型召回短板 — kastnerkyle · 2026-09-12
- 哈佛研究员用果蝇大脑连接组交易比特币,1.5 天跑赢 ML 模型 — Scobleizer · 2026-09-12