从零推 KV cache 账:LLM 大规模推理优化深度工作坊

AI Engineer · youtube · 2026-09-08

Audible 高级工程师 Harshul Jain 与独立研究者 Tanmay Sah 的超长工作坊,从第一性原理拆解 LLM 推理成本与优化。

核心数字:Mistral 7B 上单个 token 的 KV cache 占 131 KB;1.6 万 token 上下文 × 80 并发用户,仅 cache 就要 42 GB 显存,这就是 24 GB 显卡上请求开始挂掉的原因。

三大痛点:显存随上下文增长、首 token 时间随 prompt 变长退化、朴素串行服务导致吞吐崩溃。

模型侧优化:量化、Multi-Head → Multi-Query → Grouped-Query → Latent Attention 演进、Flash Attention 与 tiling。

服务侧优化:借鉴操作系统分页的 Paged Attention、continuous batching、prefix caching、KV 量化,均与 baseline 对比跑分。

引擎选型结论:标准负载下 vLLM 与 SGLang 无统计显著差异;一旦出现 agentic 分支场景,差距拉大到 3–4 倍。配套幻灯片与可运行 notebook 开放在 repo 中。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →