微软推出全带宽Transformer 提升模型推理效率
微软研究院提出“全带宽Transformer”架构,针对自回归模型解码时仅回传采样token、丢弃顶层隐藏状态的信息瓶颈,通过门控线性单元将上一步顶层隐状态作为反馈传入下一步。实验显示,1B参数的该模型效果可媲美1.5倍数据量训练的基线,从而提升推理效率。
2026-08-14 ~ 2026-08-15 · 3 条相关
- 1B模型媲美1.5倍数据量:全带宽Transformer架构 — ProfBuehlerMIT · 2026-08-14
- 微软提出全带宽 Transformer:引入隐式反馈提升推理效率 — MicrosoftResearch · 2026-08-14
- 新论文提出全带宽 Transformer,引入潜在反馈机制 — burny_tech · 2026-08-15