英伟达用线性代数解决多模型切换 KV 缓存难题
bendee983 · x · 2026-08-22
多 LLM 智能体系统在模型间移交任务时,因 KV 缓存失效需重复预填充,导致长任务成本高昂且缓慢。英伟达研究人员提出跨模型 KV 缓存转换技术,避免重复计算。
主要发现是,在同系模型间(如不同尺寸的 Qwen3),仅需简单代数技巧(无需基于梯度的深度学习方法)即可高精度映射 KV 缓存。为此设计的系统包含三个关键组件,其中之一是使用简单线性回归的映射器。该技术比从头重新计算快高达 25 倍。
「Infra」频道最新
- Cloudera 推出 Anywhere Cloud 平台,主打 Agent 与数据主权 — DavidLinthicum · 2026-08-22
- 医院内网 MLOps 实战:监控自研与第三方模型 — zentax2001 · 2026-08-22
- Agent 负载需关注单线程效能,而非单纯堆核心数 — BenBajarin · 2026-08-22
- 光互联升级遇阻:制造瓶颈将延缓 CPO/NPO 普及 — BenBajarin · 2026-08-22
- Anthropic 挖角谷歌 TPU 业务负责人,加码自研芯片 — nmasc_ · 2026-08-22
- Lambda 组建万卡 GB300 集群,跑通 All-Reduce 算力测试 — TheZachMueller · 2026-08-22