北大/易鑫 EMNLP 论文:模型答错≠不会,「读出瓶颈」掩盖真实推理力

机器之心 · wechat · 2026-09-18

北京大学与易鑫 AI Lab 的合作研究(EMNLP 2026 主会)提出「读出瓶颈」(Readout Bottleneck):大模型答错逻辑题,可能不是没推导出来,而是隐藏状态中已编码正确答案,却在输出层映射时被系统性偏置掩盖。

诊断发现

极简修正

因果对照:剔除 TF-IDF 词汇捷径样本后仍稳定;置换检验排除「仅拉平标签分布」的解释。局限:模型内部本无有效表征(如 Pythia 系列)、基线已近上限、极端失衡环境不适用。这也为思维链更有效提供了机理解释——多步输出分散了单步读出负担。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →