循环Transformer共享KV cache省内存还降困惑度

康奈尔教授 Yoav Artzi 转发的新预印本《The Surprising Effectiveness of Shared Memory in Looped Transformers》发现,训练循环 Transformer 时不应为每次递归单独维护 KV cache,而应跨递归共享同一份。实验表明这种内存共享是净正向的归纳偏置,可节省约 76-79% 的上下文内存,同时困惑度反而更低,实现了省内存与提升性能的双重收益。

2026-10-07 ~ 2026-10-07 · 2 条相关