跨模型复用 KV Cache:英伟达新研究让推理提速 25 倍
theomitsa · x · 2026-08-07
NVIDIA 研究团队提出了一种跨模型 KV Cache 迁移技术。在 LLM 家族(如 Qwen3 14B 到 32B)中切换不同规模的模型时,传统做法需要重新计算上下文的 prefill,而该技术允许目标模型直接复用源模型的 KV Cache,从而完全跳过 prefill 阶段。
研究发现,匹配的 KV 对之间存在显著的线性结构。基于此,团队设计了一个闭式岭回归映射器,通过选取最具预测性的源层并拼接其 KV 作为输入,大幅提升了转换效率。
实验表明,该转换过程比重新处理上下文快 2.7 到 25 倍,这对于优化级联模型、对话中途切换以及降低大模型 API 输入成本具有重要意义。
所属事件:英伟达新研究实现跨模型复用 KV Cache(2 条相关)→
「Infra」频道最新
- Maestro v1.6.0 发布:支持 MiniMax H3 全模型与本地视频音频生成 — cocktailpeanut · 2026-08-08
- Altman 祝贺核能初创 Oklo 反应堆达成临界 — sama · 2026-08-08
- 开源工具可视化 LLM API 价格波动,助力申请本地算力预算 — olddoglearnsnewtrick · 2026-08-08
- 万安培级 AI 芯片供电与散热面临严峻工程挑战 — jwt0625 · 2026-08-08
- 低内存本地运行 Kimi K3 的三种实用方案 — theomitsa · 2026-08-08
- llama.cpp 新 PR 优化视觉提示词,重复图像处理提速 13 倍 — BTA_Labs · 2026-08-08