英伟达用线性代数解决多模型切换 KV 缓存难题

bendee983 · x · 2026-08-22

多 LLM 智能体系统在模型间移交任务时,因 KV 缓存失效需重复预填充,导致长任务成本高昂且缓慢。英伟达研究人员提出跨模型 KV 缓存转换技术,避免重复计算。

主要发现是,在同系模型间(如不同尺寸的 Qwen3),仅需简单代数技巧(无需基于梯度的深度学习方法)即可高精度映射 KV 缓存。为此设计的系统包含三个关键组件,其中之一是使用简单线性回归的映射器。该技术比从头重新计算快高达 25 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →