xHC 让残差流扩展到 N=4 之外
pmttyji · reddit · 2026-07-20
这篇论文提出了 xHC(Expanded Hyper-Connections),目的是把 Transformer 的 residual stream 往更宽的方向扩展,而不是只靠模型宽度或深度增长。
核心思路
- Hyper-Connections(HC)会把 residual stream 扩成 N 条并行流,相当于提供一种记忆扩容方式。
- 但已有 HC 方法通常只在 N=4 以内有效;继续增大时,收益开始递减,训练成本快速上升。
为何会失效
作者指出两个瓶颈:
- 随着 stream 数量增加,写回信息不够
- residual mixing 的生成成本会随 N 呈立方增长
xHC 怎么改
- 用 temporal feature augmentation 提供更丰富的写回信息
- 用 稀疏 residual-stream 架构:在 N=16 条流里只更新 k=4 条,同时仍能密集访问完整 residual state
实验结果
在 18B 和 28B MoE 模型上,xHC 都带来稳定收益。
- 在一个 18B MoE 模型上,平均下游分数比 mHC 提升 4.0 分
- 相比 vanilla baseline,训练 FLOPs 只增加少量
- scaling-law 实验显示,要达到相同 loss,vanilla 和 mHC 需要分别消耗 1.50× 和 1.19× 于 xHC 的计算量
xHC-Flash
为了让大 N 训练更可行,作者还提出 xHC-Flash,把每层的 memory traffic 从 73.5C 降到 40C,接近 N=4 时 mHC 的 34C,同时保留完整 xHC 的收益。
结论是:xHC 让“大 N residual-stream 扩展”同时变得更有效、更实用。
所属事件:xHC架构突破Transformer残差流扩展瓶颈(2 条相关)→
「研究」频道最新
- Krea 2 LoKr 人像训练指南称,750 步通常就够做出高相似度 — LilBrownBebeShoes · 2026-07-22
- 新论文提出 PoLar:动态跳过或循环 LLM 层级以优化推理 — ttkciar · 2026-07-22
- 斯坦福新论文:当消费者与监管者使用 AI 基准测试时会发生什么 — chrmanning · 2026-07-22
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- ICML 教程探讨:优化理论在 2026 年的相关性 — srush_nlp · 2026-07-22