Cornell/IBM 新论文:共享 KV 缓存让循环模型省 76-79% 内存还更准

yoavartzi · x · 2026-10-10

Cornell 与 IBM Research 提出循环预测 Transformer(LPT),针对循环模型(Looped Transformers)每轮递归各自维护 KV 缓存、导致内存随计算量增长的问题。

核心做法:预训练时只让第一轮递归写入 KV 缓存,后续轮次复用共享缓存,仅保留很小的本地窗口。意外发现是,共享记忆不但没有损失质量,反而提升了质量。

关键结果:在 150M-1B 参数规模上,五轮递归的混合变体相对同尺寸标准 Transformer,将 FineWeb-Edu 验证困惑度降低 1.12-1.82,下游准确率更高,同时上下文内存节省 76-79%,代价是约 3-3.5 倍的推理计算量。

机制分析显示:共享内存与本地内存形成了不同的表征;后续递归的注意力主要落在共享内存上,共享内存还充当通往第一轮递归的"梯度高速公路"。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →