循环 Transformer 共享记忆反获提升:省 76-79% 上下文内存且困惑度更低
yoavartzi · x · 2026-10-07
Cornell 教授 Yoav Artzi 转发团队新预印本《The Surprising Effectiveness of Shared Memory in Looped Transformers》(arXiv:2610.02383)。
核心发现:循环 Transformer 通过多次复用同一层提升质量,但每次递归都写自己的 KV cache,导致内存随计算增长。作者提出让模型共享记忆——仅第一次递归写入 KV cache,后续递归只读该缓存并保留一个小的自有窗口。
结果:在 150M–1B 参数规模上,共享内存不仅不损质量反而更好。五次递归下,混合变体在 FineWeb-Edu 上验证困惑度比同尺寸标准 Transformer 低 1.12–1.82,同时上下文内存减少 76–79%。
机理分析:共享记忆与局部记忆发展出不同的表示;后续递归主要关注共享记忆,它同时充当指向第一次递归的「梯度高速公路」,让反向传播更顺畅。作者称这是循环模型新的质量-内存前沿。
「研究」频道最新
- AI 数学证明走向开源式协作:方格装箱证明附可视化讲解 — ctjlewis · 2026-10-07
- 开源平台 Overmind:用生产轨迹持续训练与改进 AI Agent — cneuralnetwork · 2026-10-07
- 研究发现:top-k logits 泄露的信息量与 tuned lens 相当 — sineadwilliamso · 2026-10-07
- AutoAWQ 作者:约 4.3 万美元和一个 B300 节点四周可复现 Bonsai 2 — airesearch12 · 2026-10-07
- COLM 2026 新研究:下游任务早接触统一安全预训练视角 — AdtRaghunathan · 2026-10-07
- SWE Decision Index v0.3 发布:私有关卡+视觉评测防刷榜 — multimodalart · 2026-10-07