LIFT 架构让 Transformer 获得深层到浅层反馈,训练仍可完全并行
megamor2 · x · 2026-10-01
新工作提出 Latent Information Feedback Transformers(LIFT):标准 LM 中深层信息只能通过解码出的 token 向低层传播,形成瓶颈;直接用状态传播让模型变递归则训练无法扩展。LIFT 用教师监督的训练方法,让 Transformer LM 在保持预训练完全并行的前提下利用深层到浅层的反馈通路。
- 在等 token 预算下,LIFT 在语言建模、下游推理和程序性任务上持续优于标准 Transformer 与基线
- 等算力预算下持平或领先
- 在状态追踪任务上,训练数据少 8 倍仍胜过用 8 倍数据训练的标准 Transformer
所属事件:LIFT 架构让 Transformer 实现深层向浅层反馈(2 条相关)→
「研究」频道最新
- 斯坦福理论计算机学者:LLM 已逼近千禧年难题,学界该走出否认 — burny_tech · 2026-10-01
- Evo-Φ36 冷冻电镜结构入选 PDB 55 周年「本月分子」专题 — BrianHie · 2026-10-01
- 公开数据集为何值得警惕:好数据没人愿意白送 — yenkel · 2026-10-01
- Boston Dynamics 为 Atlas 装上 13 自由度灵巧手,为 sim-to-real 强化学习而生 — chris_j_paxton · 2026-10-01
- Karl Friston 播客:超越自由能原理,被好奇心驱动的一生 — burny_tech · 2026-10-01
- LSD 在线蒸馏法消解 RL 后训练的「长度税」,减少近 23 个百分点 — Xu Wan · 2026-10-01