微软提出解码时复用隐状态以零成本提升LLM性能

微软 AI Frontiers 团队提出了一种新颖的大语言模型性能提升方法。通过修改 Transformer 架构以支持递归状态,在模型解码阶段将前一个 token 的隐状态与当前的 token embedding 一同作为输入。这种方法能够在不增加额外推理计算成本的前提下,有效提升模型的生成表现。

2026-08-12 ~ 2026-08-13 · 2 条相关