改进 Transformer 深度注意力:多头注意力残差提升模型表现

heghbalz · x · 2026-08-02

传统 Transformer 在跨深度传递信息时,通常只使用单一的注意力残差流。这导致不同特征子空间被迫共享同一个查询分布,随着模型宽度增加,性能损耗变大。

论文《Multi-Head Attention Residuals》提出了一种新方法 MHAR:

所属事件:MHAR 改进 Transformer 残差连接以降低模型验证损失(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →