北大/易鑫 EMNLP 论文:模型答错≠不会,「读出瓶颈」掩盖真实推理力
机器之心 · wechat · 2026-09-18
北京大学与易鑫 AI Lab 的合作研究(EMNLP 2026 主会)提出「读出瓶颈」(Readout Bottleneck):大模型答错逻辑题,可能不是没推导出来,而是隐藏状态中已编码正确答案,却在输出层映射时被系统性偏置掩盖。
诊断发现
- 线性探针从隐藏状态解码正确答案准确率极高(Qwen3.5-9B 在最难 lexical-OOD 切片达 0.830)
- 信号流经词表投影后衰减至 0.574,累加整段候选短语对数概率后跌至 0.333(盲猜水平);原生序列打分下 1000 题中 999 题被判为同一标签
极简修正
- 不改模型参数、不用测试标签,仅给每个候选类别加全局标量偏移(三分类仅 2 个自由参数,用 25 个无标签样本拟合)
- ProofWriter 上准确率从 33.3% 升至 65.3%–67.8%,FOLIO/ANLI 提升 9–29 个百分点;OLMo-2-1B 0.362→0.566,Llama-3.1-8B 0.333→0.477
因果对照:剔除 TF-IDF 词汇捷径样本后仍稳定;置换检验排除「仅拉平标签分布」的解释。局限:模型内部本无有效表征(如 Pythia 系列)、基线已近上限、极端失衡环境不适用。这也为思维链更有效提供了机理解释——多步输出分散了单步读出负担。
「模型」频道最新
- 本地跑 Qwen 模型生成 2500 万 token,用户盛赞其指令遵循拉低下限 — mateszhun · 2026-09-18
- Nate Silver:AI 在图形空间任务已很强,文字任务仍平庸 — ajeya_cotra · 2026-09-18
- openjev 重排模型登上 Hugging Face 趋势榜 — AlexWortega · 2026-09-18
- 用户抱怨 Codex 已 6 天未重置,向官方喊话求额度 — cneuralnetwork · 2026-09-18
- Jev playground 显示推理与往返延迟,欧洲访问多付 120ms — DanielLockyer · 2026-09-18
- ChatGPT 近期不查资料改瞎猜,Reddit 用户抱怨扭矩、尺寸全靠编 — WeissMISFIT · 2026-09-18