LLM 推理入门长文:Prefill、Decode 与 KV Cache 一次讲透
kmeanskaran · x · 2026-09-17
一篇面向已懂 attention 与 transformer 的读者的推理系统入门长文,目标是让读者能完整走通一个请求在 GPU 上的旅程,把 FlashAttention、PagedAttention、continuous batching、RadixAttention 等名词当作优化手段而非玄学,并看清 2026 年推理服务栈的全貌。
作者指出常见误区:大家熟悉训练叙事,但推理仍是一堆孤立名词(FlashAttention、vLLM、HBM、KV cache),以为微调后调用 generate() 就是“少了反向传播的同一个网络”——这种认知导致人们在说不出哪一阶段慢之前就急着上优化。文章不需要 CUDA 基础,只需懂 Q/K/V 和一个已训练的模型,从 GPU 内存术语讲起逐层展开,不涉及 kernel 编写。
「Infra」频道最新
- 「token 中介」谁在反哺开源?作者晒主流推理引擎上游 PR 贡献数据 — michellechen · 2026-09-17
- C++ 编写:在 Intel NPU/iGPU 上零 Python 跑本地 LLM 的开源工具 — Spiritual-Ad-5916 · 2026-09-17
- 芯片电池电机 34 年降价 99%+,ARK 投资人称 AI 年成本降幅超 99% — skorusARK · 2026-09-17
- MLPerf Inference v6.1 发布:30 家参测创纪录,新增 Agentic 推理基准 — TheKanter · 2026-09-17
- NVIDIA 携手 Google 与 Emerald AI 成立联盟,推动数据中心「柔性用电」接入电网 — dr_alphalyrae · 2026-09-17
- CoreWeave 部署多机柜 NVIDIA Vera Rubin NVL72 集群 — OnlineInference · 2026-09-17