苹果 KV-Lingo 论文:跨模型切换 LLM 提速最高 29 倍
Gauri_the_great · x · 2026-10-02
对话中途切换 LLM 通常需要重算前缀 KV cache,因为缓存绑定于各模型的架构与参数。苹果新论文 KV-Lingo 训练一个线性"翻译器",把源模型的 KV 缓存直接映射到目标模型的表示空间,免去重新 prefill。
方法要点
- 对目标模型的每一层,用独立的线性映射逐 token 变换源模型的 key 和 value;模型层数不同时可读取源模型的层子集。
- 训练分两阶段:先用闭式最小二乘拟合目标模型的原生缓存,再通过目标模型自蒸馏,优化预测分布的 KL 散度一致性(而非逐元素缓存重建误差)。只训练翻译器,两个模型均冻结。
- 翻译计算量随前缀长度线性增长且不含注意力计算。
实测结果
- 在 H100 上,对同构 Qwen3 模型对,2k token 前缀下切换速度比重新 prefill 快 4.8–5.6 倍,32k token 下快 12–29 倍,后续解码保持原生速度。
- 多次切换时各模型保留自己的缓存,只翻译新生成片段。
- 9 个基准测试(关闭推理模式)中,蒸馏线性翻译器大致达到小模型的平均性能;Qwen3-0.6B↔8B 上,head-mixing 版本小到大迁移得 0.577,大到小 0.476,小模型原生为 0.506。
论文也承认质量依赖模型对与任务:翻译缓存并不能稳定恢复大模型的原生性能。
「Infra」频道最新
- 本地 AI 项目 TensorFold 寻求赞助,聚焦深度性能优化 — EAccelerate_42 · 2026-10-02
- Cascadia 构建许可制点对点 AI 推理网络 — techne98 · 2026-10-02
- 亚马逊承诺 10 亿美元社区支持,争取 AI 数据中心落地民意 — pstAsiatech · 2026-10-02
- 麒麟9050裸片曝光:120.6mm²、台积电N2P工艺 — zephyr_z9 · 2026-10-02
- RTX 5090 实测:软件优化后 LTX 2.5 可生成 60 秒长视频 — OpenEffect3955 · 2026-10-02
- AI Agent 已可看屏+语音操控,下一步是眼动追踪? — perilli · 2026-10-02