跨模型复用 KV Cache:英伟达新研究让推理提速 25 倍

theomitsa · x · 2026-08-07

NVIDIA 研究团队提出了一种跨模型 KV Cache 迁移技术。在 LLM 家族(如 Qwen3 14B 到 32B)中切换不同规模的模型时,传统做法需要重新计算上下文的 prefill,而该技术允许目标模型直接复用源模型的 KV Cache,从而完全跳过 prefill 阶段。

研究发现,匹配的 KV 对之间存在显著的线性结构。基于此,团队设计了一个闭式岭回归映射器,通过选取最具预测性的源层并拼接其 KV 作为输入,大幅提升了转换效率。

实验表明,该转换过程比重新处理上下文快 2.7 到 25 倍,这对于优化级联模型、对话中途切换以及降低大模型 API 输入成本具有重要意义。

所属事件:英伟达新研究实现跨模型复用 KV Cache(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →