Cornell/IBM 新论文:共享 KV 缓存让循环模型省 76-79% 内存还更准
yoavartzi · x · 2026-10-10
Cornell 与 IBM Research 提出循环预测 Transformer(LPT),针对循环模型(Looped Transformers)每轮递归各自维护 KV 缓存、导致内存随计算量增长的问题。
核心做法:预训练时只让第一轮递归写入 KV 缓存,后续轮次复用共享缓存,仅保留很小的本地窗口。意外发现是,共享记忆不但没有损失质量,反而提升了质量。
关键结果:在 150M-1B 参数规模上,五轮递归的混合变体相对同尺寸标准 Transformer,将 FineWeb-Edu 验证困惑度降低 1.12-1.82,下游准确率更高,同时上下文内存节省 76-79%,代价是约 3-3.5 倍的推理计算量。
机制分析显示:共享内存与本地内存形成了不同的表征;后续递归的注意力主要落在共享内存上,共享内存还充当通往第一轮递归的"梯度高速公路"。
「Infra」频道最新
- 2000 个 Agent 共享一颗 CPU:Daytona 详解 Agent 运行环境设计 — mattturck · 2026-10-10
- 德州排队用电飙至 474GW,90% 来自数据中心 — FinanceYF5 · 2026-10-10
- 256GB DDR5 涨到 7200 美元,工程师把它当保值资产抢购 — CtrlAltDwayne · 2026-10-10
- Lemire 2026 重测 WebSocket:Bun 曾被高估, Anthropic 买下 Bun、Cloudflare 买下 Deno — lemire · 2026-10-10
- 4GB 显存跑本地模型,除了 llama.cpp 还有更快的选择吗? — your_real_Fathe_ · 2026-10-10
- Cascade 拓扑反而更慢?多卡 P2P 通信的 PCIe 跳数陷阱 — TheZachMueller · 2026-10-10