xHC 让残差流扩展到 N=4 之外
pmttyji · reddit · 2026-07-20
这篇论文提出了 xHC(Expanded Hyper-Connections),目的是把 Transformer 的 residual stream 往更宽的方向扩展,而不是只靠模型宽度或深度增长。
核心思路
- Hyper-Connections(HC)会把 residual stream 扩成 N 条并行流,相当于提供一种记忆扩容方式。
- 但已有 HC 方法通常只在 N=4 以内有效;继续增大时,收益开始递减,训练成本快速上升。
为何会失效
作者指出两个瓶颈:
- 随着 stream 数量增加,写回信息不够
- residual mixing 的生成成本会随 N 呈立方增长
xHC 怎么改
- 用 temporal feature augmentation 提供更丰富的写回信息
- 用 稀疏 residual-stream 架构:在 N=16 条流里只更新 k=4 条,同时仍能密集访问完整 residual state
实验结果
在 18B 和 28B MoE 模型上,xHC 都带来稳定收益。
- 在一个 18B MoE 模型上,平均下游分数比 mHC 提升 4.0 分
- 相比 vanilla baseline,训练 FLOPs 只增加少量
- scaling-law 实验显示,要达到相同 loss,vanilla 和 mHC 需要分别消耗 1.50× 和 1.19× 于 xHC 的计算量
xHC-Flash
为了让大 N 训练更可行,作者还提出 xHC-Flash,把每层的 memory traffic 从 73.5C 降到 40C,接近 N=4 时 mHC 的 34C,同时保留完整 xHC 的收益。
结论是:xHC 让“大 N residual-stream 扩展”同时变得更有效、更实用。
所属事件:xHC架构突破Transformer残差流扩展瓶颈(2 条相关)→
「研究」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11