循环Transformer共享KV cache省内存还降困惑度
康奈尔教授 Yoav Artzi 转发的新预印本《The Surprising Effectiveness of Shared Memory in Looped Transformers》发现,训练循环 Transformer 时不应为每次递归单独维护 KV cache,而应跨递归共享同一份。实验表明这种内存共享是净正向的归纳偏置,可节省约 76-79% 的上下文内存,同时困惑度反而更低,实现了省内存与提升性能的双重收益。
2026-10-07 ~ 2026-10-07 · 2 条相关
- 循环 Transformer 共享记忆反获提升:省 76-79% 上下文内存且困惑度更低 — yoavartzi · 2026-10-07
- 循环 Transformer 跨递归共享 KV cache:省内存还提升性能 — yoavartzi · 2026-10-07