英伟达新研究:跨模型线性映射复用 KV Cache,推理提速 25 倍
rohanpaul_ai · x · 2026-08-07
英伟达最新论文提出了一种跨模型复用提示词记忆(KV Cache)的方法。当系统切换大模型时,新模型通常需要重新读取整个对话来构建缓存,而该方法通过一个简单的线性转换器,让相关模型能直接复用已缓存的记忆,跳过重新处理长对话的过程。
技术细节与表现:
- 该映射器学习目标注意力头与源层的关联,在转换前移除位置信息并在转换后恢复。
- 仅需 500 个校准序列即可完成学习,无需反向传播,但要求模型具有匹配的缓存形状。
- 在 Qwen3、Llama 3.1 等的 6 组模型测试中,保留了 73% 到 98% 的基准准确率。
- 转换过程速度提升了 2.7 至 25 倍,且 Qwen3 在 10 轮对话中表现稳定。
研究还发现,成功的核心不在于总转换误差大小,而在于误差是否落在注意力机制实际读取的位置。
「Infra」频道最新
- SK海力士2Q26业绩预测不及预期,HBM占比与LTA效应压低ASP涨幅 — zephyr_z9 · 2026-08-07
- 50 人团队如何自建私有 RAG 系统?Mac Mini 集群方案探讨 — rogo725 · 2026-08-07
- 谷歌 TPU v7 并未低价出售,算力硬件成本居高不下 — zephyr_z9 · 2026-08-07
- 2900美元换64G显存?开发者纠结AMD显卡升级方案 — milkipedia · 2026-08-07
- 独立开发者控诉:Meta AI 爬虫疯狂抓取,致服务器过载 — Polymarket · 2026-08-07
- 曝 DeepMind 仅获 GCP 15% 算力,引发内部资源分配担忧 — zephyr_z9 · 2026-08-07