图解大模型推理:Prefill 与 Decode 两阶段如何影响速度
techNmak · x · 2026-08-12
这篇长文从底层机制剖析了 LLM 推理慢的原因,将生成过程拆解为两个核心阶段:
- Prefill(预填充)阶段:模型对输入的 Prompt 进行分词,并通过 Transformer 层进行高度并行化计算,同时构建 KV Cache。这一阶段的工作量直接决定了首字响应时间(TTFT),Prompt 越长,等待首个 Token 出现的时间通常也越长。
- Decode(解码)阶段:模型开始逐个生成新 Token。这是一个严格的串行过程(第 N 个 Token 依赖于第 N-1 个 Token),并不断复用和更新之前的 KV Cache。这一阶段的速度由每秒生成 Token 数(TPS)衡量。
作者指出,除了输入和输出长度,模型架构、显存压力、硬件带宽和批处理大小等因素都会显著影响推理的速度和成本。因此,当模型响应缓慢时,应区分是“首字出现慢”(Prefill 瓶颈)还是“后续生成慢”(Decode 瓶颈)。
「Infra」频道最新
- 低显存跑 MiniMax H3 烧毁显卡?用户实测翻车警告 — ROBOTTTTT13 · 2026-08-12
- StarCloud 探索太空数据中心:将 AI 硬件送入轨道 — DavidLinthicum · 2026-08-12
- gakonst 为 nanocodex 添加机密计算支持,实现可验证的机密 AI — AccBalanced · 2026-08-12
- 阿里云 CUBE 5.0 模块化设计:100 天建成 AI 数据中心并降本 10% — rohanpaul_ai · 2026-08-12
- CoreWeave 获 26 亿美元信贷,押注英伟达 GPU 长期价值 — OnlineInference · 2026-08-12
- poolside 举办 Laguna 模型加速赛,社区将其推理速度提升 2.6 倍 — gajesh · 2026-08-12