循环 Transformer 跨递归共享 KV cache:省内存还提升性能
yoavartzi · x · 2026-10-07
新预印本研究发现,训练 looped(循环)Transformer 时不应为每次递归单独维护 KV cache,而应跨递归共享同一份。结论:
- 内存共享是净正向的归纳偏置:不仅省内存,还提升性能与稳定性
- 同等 FLOPs、更少内存、更高质量
- 作者给出了详细论文链接与技术线程
Yoav Artzi 等研究者转发推荐,认为这对循环模型架构设计是重要修正。
所属事件:循环Transformer共享KV cache省内存还降困惑度(2 条相关)→
「研究」频道最新
- Fleuret:数学的真理「与上下文无关」,这是其他领域都不具备的特质 — francoisfleuret · 2026-10-07
- 推理模型问世仅两年,AI 已贡献相当于 20 枚菲尔兹奖的数学成果 — __nmca__ · 2026-10-07
- 新加坡国立大学发布 SafeActBench:656 例剖析工具型 Agent 从证据到行动的断点 — NationalUniversityofSingapore · 2026-10-07
- MEND:近端速度匹配强化学习,100 步训练超越 Flow-GRPO 约 4000 步 — UTEXAS · 2026-10-07
- JLD 感知距离:从冻结视觉编码器雅可比矩阵导出,100 张图 35 秒拟合即超 LPIPS — Shreshth Saini · 2026-10-07
- 港科大综述「参数内记忆」:让 LLM 把后训练知识写进权重而非上下文 — HKUST · 2026-10-07