微软推出全带宽Transformer 提升模型推理效率

微软研究院提出“全带宽Transformer”架构,针对自回归模型解码时仅回传采样token、丢弃顶层隐藏状态的信息瓶颈,通过门控线性单元将上一步顶层隐状态作为反馈传入下一步。实验显示,1B参数的该模型效果可媲美1.5倍数据量训练的基线,从而提升推理效率。

2026-08-14 ~ 2026-08-15 · 3 条相关