苹果 KV-Lingo 论文:跨模型切换 LLM 提速最高 29 倍

Gauri_the_great · x · 2026-10-02

对话中途切换 LLM 通常需要重算前缀 KV cache,因为缓存绑定于各模型的架构与参数。苹果新论文 KV-Lingo 训练一个线性"翻译器",把源模型的 KV 缓存直接映射到目标模型的表示空间,免去重新 prefill。

方法要点

实测结果

论文也承认质量依赖模型对与任务:翻译缓存并不能稳定恢复大模型的原生性能。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →