LLM 推理入门长文:Prefill、Decode 与 KV Cache 一次讲透

kmeanskaran · x · 2026-09-17

一篇面向已懂 attention 与 transformer 的读者的推理系统入门长文,目标是让读者能完整走通一个请求在 GPU 上的旅程,把 FlashAttention、PagedAttention、continuous batching、RadixAttention 等名词当作优化手段而非玄学,并看清 2026 年推理服务栈的全貌。

作者指出常见误区:大家熟悉训练叙事,但推理仍是一堆孤立名词(FlashAttention、vLLM、HBM、KV cache),以为微调后调用 generate() 就是“少了反向传播的同一个网络”——这种认知导致人们在说不出哪一阶段慢之前就急着上优化。文章不需要 CUDA 基础,只需懂 Q/K/V 和一个已训练的模型,从 GPU 内存术语讲起逐层展开,不涉及 kernel 编写。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →