xHC 让残差流扩展到 N=4 之外
pmttyji · reddit · 2026-07-20
这篇论文提出了 xHC(Expanded Hyper-Connections),目的是把 Transformer 的 residual stream 往更宽的方向扩展,而不是只靠模型宽度或深度增长。
核心思路
- Hyper-Connections(HC)会把 residual stream 扩成 N 条并行流,相当于提供一种记忆扩容方式。
- 但已有 HC 方法通常只在 N=4 以内有效;继续增大时,收益开始递减,训练成本快速上升。
为何会失效
作者指出两个瓶颈:
- 随着 stream 数量增加,写回信息不够
- residual mixing 的生成成本会随 N 呈立方增长
xHC 怎么改
- 用 temporal feature augmentation 提供更丰富的写回信息
- 用 稀疏 residual-stream 架构:在 N=16 条流里只更新 k=4 条,同时仍能密集访问完整 residual state
实验结果
在 18B 和 28B MoE 模型上,xHC 都带来稳定收益。
- 在一个 18B MoE 模型上,平均下游分数比 mHC 提升 4.0 分
- 相比 vanilla baseline,训练 FLOPs 只增加少量
- scaling-law 实验显示,要达到相同 loss,vanilla 和 mHC 需要分别消耗 1.50× 和 1.19× 于 xHC 的计算量
xHC-Flash
为了让大 N 训练更可行,作者还提出 xHC-Flash,把每层的 memory traffic 从 73.5C 降到 40C,接近 N=4 时 mHC 的 34C,同时保留完整 xHC 的收益。
结论是:xHC 让“大 N residual-stream 扩展”同时变得更有效、更实用。
所属事件:xHC架构突破Transformer残差流扩展瓶颈(2 条相关)→
「研究」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27