MHAR 改进 Transformer 残差连接以降低模型验证损失

针对标准 Transformer 依赖单一残差流导致不同特征子空间共享查询分布、模型变宽时性能受损的问题,研究人员提出了多头注意力残差(MHAR)。该方法将路由查询重塑为多个头,有效缓解了跨深度传递信息时的特征妥协。实验表明,该方法在 10 亿参数规模下成功降低了模型的验证损失,显著提升了整体表现。

2026-07-31 ~ 2026-08-02 · 2 条相关