Full-bandwidth Transformer 论文更新:潜反馈通道提升 1B 模型效率

_arohan_ · x · 2026-10-06

作者 Xi Wang(与 John Langford 等)发布 Full-bandwidth Transformer 论文 v2 修订版,并放出非官方代码。

核心思路:标准自回归 transformer 中,层间垂直反馈通道很窄——每个解码步只有采样出的 token 回到底层,顶层隐藏状态被丢弃。该工作引入 latent feedback:每步把上一步的顶层隐藏状态通过门控线性单元与采样 token 的 embedding 融合后作为下一步输入,让未言语化的计算以新的深度预算重新进入网络,同时保持标准架构、KV cache 和语言建模目标不变。

训练方法:采用 scheduled multi-pass 目标,在预训练后期才引入 latent feedback,并混入少量更深的反馈 pass 以保证并行 teacher forcing 与稳定性。

结果:1B 参数模型在最多 400B token 上训练,latent feedback 改善了验证损失、5-shot 语言建模、数学与代码生成及指令微调表现;每 token 解码开销可忽略的情况下,性能接近用约 1.5 倍 token 训练的标准 transformer。

本次修订新增了调试训练 run、post-training/KV cache replay、替代融合门等讨论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →