循环 Transformer 跨递归共享 KV cache:省内存还提升性能

yoavartzi · x · 2026-10-07

新预印本研究发现,训练 looped(循环)Transformer 时不应为每次递归单独维护 KV cache,而应跨递归共享同一份。结论:

Yoav Artzi 等研究者转发推荐,认为这对循环模型架构设计是重要修正。

所属事件:循环Transformer共享KV cache省内存还降困惑度(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →