研究发现 LM Head 导致 95-99% 梯度在反向传播中丢失
tokenbender · x · 2026-08-16
一篇提交至 COLM'26 的论文指出,语言模型(LM)的最后一层不仅是表达瓶颈,更是优化瓶颈。由于将维度 D 的输出投影到词汇表维度 V(通常 D 远小于 V),导致在通过该层反向传播时不可避免地压缩梯度。
关键发现:
- 梯度丢失严重: 实验测量显示,95-99% 的梯度范数被输出层抑制,导致更新方向严重次优。
- 影响训练效率: 这种缺陷使得模型难以学习简单模式,严重影响大模型训练动力学。
- 架构无关性: 无论何种模型架构,这种固有的设计缺陷都会导致大规模训练效率低下。
所属事件:论文指LM Head为梯度瓶颈,95%-99%梯度丢失(3 条相关)→
「研究」频道最新
- IBM 研究:基准测试高分依赖措辞,强模型更脆弱 — omarsar0 · 2026-08-16
- HUSKY 系统发布:人形机器人可完成动态滑板动作 — tom_doerr · 2026-08-16
- ArchAgent v2:多级数据预取的智能体架构发现 — dair_ai · 2026-08-16
- 新开源库 LLMRouter 统一 16+ 路由实现,发布 xRouteBench 基准 — Justgototheeffinmoon · 2026-08-16
- 新方法:用部分推理轨迹训练学生模型,无需实时环境 — YouJiacheng · 2026-08-16
- LLM在复杂结构化输出时易出错,开发者分享“研究员-格式化器”拆分架构 — DiligentBend9150 · 2026-08-16