循环 Transformer 共享记忆反获提升:省 76-79% 上下文内存且困惑度更低

yoavartzi · x · 2026-10-07

Cornell 教授 Yoav Artzi 转发团队新预印本《The Surprising Effectiveness of Shared Memory in Looped Transformers》(arXiv:2610.02383)。

核心发现:循环 Transformer 通过多次复用同一层提升质量,但每次递归都写自己的 KV cache,导致内存随计算增长。作者提出让模型共享记忆——仅第一次递归写入 KV cache,后续递归只读该缓存并保留一个小的自有窗口。

结果:在 150M–1B 参数规模上,共享内存不仅不损质量反而更好。五次递归下,混合变体在 FineWeb-Edu 上验证困惑度比同尺寸标准 Transformer 低 1.12–1.82,同时上下文内存减少 76–79%。

机理分析:共享记忆与局部记忆发展出不同的表示;后续递归主要关注共享记忆,它同时充当指向第一次递归的「梯度高速公路」,让反向传播更顺畅。作者称这是循环模型新的质量-内存前沿。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →