KV cache 为何成 GPU 显存杀手:上下文长度与并发的隐藏成本拆解
techNmak · x · 2026-09-25
作者拆解 KV cache 为什么在推理服务系统中占据核心地位:模型权重在推理期间基本固定,但活跃请求的状态持续增长——每个缓存 token 都会在各注意力层留下 key/value 张量,只要对应上下文还在被使用就一直占着显存。
要点:
- 上下文长度不只是规格参数,直接对应显存成本;并发同理,每个并发请求都携带自己的 KV 状态,序列越长、并发越多,缓存越挤占显存。
- 架构选择在此立刻显效:GQA/MQA 减少 KV 头数量,KV 量化降低存储字节,滑动窗口注意力限制需要保留的历史。
- 缓存并不消除对已有上下文的注意力计算:它省掉的是旧 K/V 投影的重复计算,但 full attention 下每个新 query 仍要使用相关缓存。
结论:KV cache 正好处在上下文长度、显存容量、解码成本与服务并发四者的交汇点,是注意力方程中影响系统设计最大的小部件。
「Infra」频道最新
- 高盛:五大巨头 2027 年 AI 基建支出将超 50% 增至 1.2 万亿美元 — rohanpaul_ai · 2026-09-25
- 机器人仿真成 Bittensor SN49 最干净的防作弊激励机制 — bittingthembits · 2026-09-25
- SemiAnalysis:NVIDIA B200 跑 DeepSeek 每吉瓦年利润最高可达 150 亿美元 — zephyr_z9 · 2026-09-25
- Qdrant 开源 Supernova 嵌入工具与 10B 规模 FineWeb 数据集 — qdrant_engine · 2026-09-25
- 创业者放话:数据中心大扩建是死路,模型终将袖珍化 — draginol · 2026-09-25
- LunarG 的 KosmicKrisp 驱动通过 Vulkan 1.4 认证,性能较 1.3 时提升三倍 — ssh4net · 2026-09-25