英伟达新研究实现跨模型复用 KV Cache
英伟达研究团队提出了一项跨模型 KV Cache 迁移技术,旨在解决大模型切换时需重新计算上下文缓存的问题。该方法通过引入简单的线性转换器,使得在同系列大模型(例如从 Qwen3 14B 切换至 32B)间能够直接复用提示词记忆。实验表明,该技术避免了重新读取整个对话的开销,可将推理速度显著提升 25 倍。
2026-08-07 ~ 2026-08-07 · 2 条相关
- 英伟达新研究:跨模型线性映射复用 KV Cache,推理提速 25 倍 — rohanpaul_ai · 2026-08-07
- 跨模型复用 KV Cache:英伟达新研究让推理提速 25 倍 — theomitsa · 2026-08-07