改进 Transformer 深度注意力:多头注意力残差提升模型表现
heghbalz · x · 2026-08-02
传统 Transformer 在跨深度传递信息时,通常只使用单一的注意力残差流。这导致不同特征子空间被迫共享同一个查询分布,随着模型宽度增加,性能损耗变大。
论文《Multi-Head Attention Residuals》提出了一种新方法 MHAR:
- 核心机制:将路由查询重塑为 H 个独立的子空间头,每个头拥有自己的 softmax 来处理深度历史记录。
- 零新增参数:该操作本质上是一次 reshape,不增加额外参数和可忽略的计算开销。
- 效果显著:在 100M、350M 和 1B 参数模型上,验证损失均优于标准 Transformer,且模型越大优势越明显。
- 最佳配置:头数 H 是一个关键设计维度,H=4 或 H=8 时效果最佳,过大(如 H=16)反而会导致性能回落。
所属事件:MHAR 改进 Transformer 残差连接以降低模型验证损失(2 条相关)→
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24