改进 Transformer 残差连接,MHAR 在 1B 参数规模降低验证损失
Cheng Luo · hf · 2026-07-31
标准 Transformer 通过单一残差流传递信息,随着模型宽度增加,不同特征子空间在读取历史层信息时会产生妥协。本文提出多头注意力残差(MHAR),将路由查询重塑为多个子空间头,每个头通过独立的 softmax 读取深度历史。
该方法不增加任何参数且计算开销极小。在 100M、350M 和 1B 参数规模的从头训练实验中,MHAR 均优于标准 Transformer 及其他基线方法,且优势随规模扩大而增加。研究发现头数是一个关键设计维度,验证损失随头数呈 U 型变化,最佳取值为 4 或 8。此外,结合 Triton 融合内核提升了训练吞吐量,在 8B 模型的中期训练转换中,GSM8K 和 GPQA 评测分数分别提升了 3.2 和 3.1。
「研究」频道最新
- 3D胸部CT视觉语言模型用于自动报告生成研究被接收 — maier_ak · 2026-07-31
- Google DeepMind 解散 AlphaFold 团队,研究人员转投 Gemini — emmanuelvivier · 2026-07-31
- Glob3R:基于3D基础模型的全局SfM重建框架 — rsasaki0109 · 2026-07-31
- 港大教授Taku Komura:用消费级设备构建具身智能原生世界模型 — 量子位 · 2026-07-31
- 突破边走边抓瓶颈:CoorDex让49自由度人形机器人协同操作 — 量子位 · 2026-07-31
- 当 AI 智能体成为推荐系统用户,架构该怎么变? — _reachsumit · 2026-07-31