英伟达新研究:跨模型线性映射复用 KV Cache,推理提速 25 倍

rohanpaul_ai · x · 2026-08-07

英伟达最新论文提出了一种跨模型复用提示词记忆(KV Cache)的方法。当系统切换大模型时,新模型通常需要重新读取整个对话来构建缓存,而该方法通过一个简单的线性转换器,让相关模型能直接复用已缓存的记忆,跳过重新处理长对话的过程。

技术细节与表现:

研究还发现,成功的核心不在于总转换误差大小,而在于误差是否落在注意力机制实际读取的位置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →