研究发现 LM Head 导致 95-99% 梯度在反向传播中丢失

tokenbender · x · 2026-08-16

一篇提交至 COLM'26 的论文指出,语言模型(LM)的最后一层不仅是表达瓶颈,更是优化瓶颈。由于将维度 D 的输出投影到词汇表维度 V(通常 D 远小于 V),导致在通过该层反向传播时不可避免地压缩梯度。

关键发现:

所属事件:论文指LM Head为梯度瓶颈,95%-99%梯度丢失(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →