北大研究揭示"读出瓶颈":模型答对却说不出口

jiqizhixin · x · 2026-09-26

北京大学与 YIXIN AI Lab 的一项研究(入选 EMNLP 2026 主会,接收率 15.4%)诊断了一个问题:模型答错逻辑题,究竟是真不会推理,还是"知道答案但没说出来"?

研究者打开黑盒发现:正确答案其实已经编码在模型的隐藏状态里,但在隐藏状态转换为候选答案分数的输出层,被系统性偏差"覆盖"掉了。他们把这一现象命名为 Readout Bottleneck(读出瓶颈)。

机制上,即使模型对候选首 token 的分数仍略占优势,对整个候选字符串做序列级 log 概率累加时,误差被放大,准确率塌缩到 0.333,相当于三选一纯瞎猜。这一效应在未经指令微调的基座模型上同样成立:Qwen3.5-9B-Base 上 probing 可恢复 87.3% 的准确率,而序列打分则大幅下降。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →