微软提出解码时复用隐状态以零成本提升LLM性能
微软 AI Frontiers 团队提出了一种新颖的大语言模型性能提升方法。通过修改 Transformer 架构以支持递归状态,在模型解码阶段将前一个 token 的隐状态与当前的 token embedding 一同作为输入。这种方法能够在不增加额外推理计算成本的前提下,有效提升模型的生成表现。
2026-08-12 ~ 2026-08-13 · 2 条相关
- 微软新研究:解码时注入前序隐状态,免费提升Transformer性能 — furongh · 2026-08-12
- 微软实习项目:解码时复用隐状态,零成本提升 LLM 性能 — burny_tech · 2026-08-13