改进 Transformer 残差连接,MHAR 在 1B 参数规模降低验证损失

Cheng Luo · hf · 2026-07-31

标准 Transformer 通过单一残差流传递信息,随着模型宽度增加,不同特征子空间在读取历史层信息时会产生妥协。本文提出多头注意力残差(MHAR),将路由查询重塑为多个子空间头,每个头通过独立的 softmax 读取深度历史。

该方法不增加任何参数且计算开销极小。在 100M、350M 和 1B 参数规模的从头训练实验中,MHAR 均优于标准 Transformer 及其他基线方法,且优势随规模扩大而增加。研究发现头数是一个关键设计维度,验证损失随头数呈 U 型变化,最佳取值为 4 或 8。此外,结合 Triton 融合内核提升了训练吞吐量,在 8B 模型的中期训练转换中,GSM8K 和 GPQA 评测分数分别提升了 3.2 和 3.1。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →