MHAR 改进 Transformer 残差连接以降低模型验证损失
针对标准 Transformer 依赖单一残差流导致不同特征子空间共享查询分布、模型变宽时性能受损的问题,研究人员提出了多头注意力残差(MHAR)。该方法将路由查询重塑为多个头,有效缓解了跨深度传递信息时的特征妥协。实验表明,该方法在 10 亿参数规模下成功降低了模型的验证损失,显著提升了整体表现。
2026-07-31 ~ 2026-08-02 · 2 条相关
- 改进 Transformer 残差连接,MHAR 在 1B 参数规模降低验证损失 — Cheng Luo · 2026-07-31
- 改进 Transformer 深度注意力:多头注意力残差提升模型表现 — heghbalz · 2026-08-02