从零推 KV cache 账:LLM 大规模推理优化深度工作坊
AI Engineer · youtube · 2026-09-08
Audible 高级工程师 Harshul Jain 与独立研究者 Tanmay Sah 的超长工作坊,从第一性原理拆解 LLM 推理成本与优化。
核心数字:Mistral 7B 上单个 token 的 KV cache 占 131 KB;1.6 万 token 上下文 × 80 并发用户,仅 cache 就要 42 GB 显存,这就是 24 GB 显卡上请求开始挂掉的原因。
三大痛点:显存随上下文增长、首 token 时间随 prompt 变长退化、朴素串行服务导致吞吐崩溃。
模型侧优化:量化、Multi-Head → Multi-Query → Grouped-Query → Latent Attention 演进、Flash Attention 与 tiling。
服务侧优化:借鉴操作系统分页的 Paged Attention、continuous batching、prefix caching、KV 量化,均与 baseline 对比跑分。
引擎选型结论:标准负载下 vLLM 与 SGLang 无统计显著差异;一旦出现 agentic 分支场景,差距拉大到 3–4 倍。配套幻灯片与可运行 notebook 开放在 repo 中。
「Infra」频道最新
- 高通确认 AWS 合作已计入 FY29 150 亿美元数据中心营收目标 — BenBajarin · 2026-09-08
- 数据中心建设开支半年暴增250亿美元,招聘岗位重回30万+ — AccBalanced · 2026-09-08
- 算力金融化狂飙:GPU租赁CDO或将上市 — AccBalanced · 2026-09-08
- Citi 会议要点:超大规模商积压订单近 1.7 万亿美元,AI 资本开支剑指 3.8 万亿 — sanjaykalra · 2026-09-08
- AI 数据中心互联芯片公司 Celero 融资 2.75 亿美元,估值超 30 亿 — dinabass · 2026-09-08
- vLLM 生态 Speculators v0.8.0 发布:统一 CLI 与 Triton 融合损失核 — vllm_project · 2026-09-08