Full-bandwidth Transformer 论文更新:潜反馈通道提升 1B 模型效率
_arohan_ · x · 2026-10-06
作者 Xi Wang(与 John Langford 等)发布 Full-bandwidth Transformer 论文 v2 修订版,并放出非官方代码。
核心思路:标准自回归 transformer 中,层间垂直反馈通道很窄——每个解码步只有采样出的 token 回到底层,顶层隐藏状态被丢弃。该工作引入 latent feedback:每步把上一步的顶层隐藏状态通过门控线性单元与采样 token 的 embedding 融合后作为下一步输入,让未言语化的计算以新的深度预算重新进入网络,同时保持标准架构、KV cache 和语言建模目标不变。
训练方法:采用 scheduled multi-pass 目标,在预训练后期才引入 latent feedback,并混入少量更深的反馈 pass 以保证并行 teacher forcing 与稳定性。
结果:1B 参数模型在最多 400B token 上训练,latent feedback 改善了验证损失、5-shot 语言建模、数学与代码生成及指令微调表现;每 token 解码开销可忽略的情况下,性能接近用约 1.5 倍 token 训练的标准 transformer。
本次修订新增了调试训练 run、post-training/KV cache replay、替代融合门等讨论。
「模型」频道最新
- Reflection 发布开源模型 Beam:501B 总参、23B 激活,主打编码与 Agent — bigblueboo · 2026-10-06
- 「OCR 已经超越人类水平了」:一句感叹背后的能力跃迁 — generativist · 2026-10-06
- 开发者用回 Codex 后直呼「基本没法用」,对比 Opus 5.5 — jacob_posel · 2026-10-06
- Polymarket 给 OpenAI 2026 全面暂停训练 9% 概率,此前已两度急停 — Polymarket · 2026-10-06
- Agent Arena 榜单:Claude 系领跑智能体任务,每任务成本差距达 9 倍 — arena · 2026-10-06
- 陶哲轩曾称 FrontierMath 可抵御 AI 数年,Tier-4 已被刷爆 — haider1 · 2026-10-06