LLM 推理科普连载:Prefill 并行读、Decode 逐 token 写的时间去哪了
abhijithneil · x · 2026-09-04
@abhijithneil 的 LLM 推理入门系列第 5-6 部分,解释两个核心阶段:
- Prefill:模型读取你的 prompt,所有 prompt token 并行一次性处理,单 token 快且重负载压 GPU;prompt 越长 prefill 越长
- Decode:模型写答案,必须逐 token 生成,因为每个 token 都依赖前一个 token;你的大部分等待时间都花在这里
这是理解推理延迟与吞吐指标的基础概念。
所属事件:科普线程讲透 LLM 推理指标:TTFT、TPS 与 TPOT(4 条相关)→
「Infra」频道最新
- AMD 发布 Threadripper Halo Station:96 核 CPU 配 576GB HBM3E — ccerrato147 · 2026-09-04
- 流体基础模型 AeroJEPA 正式加入 NVIDIA PhysicsNeMo 生态 — ricardovinuesa · 2026-09-04
- 2-2.5千欧预算搭建本地 AI 工作站:律师隐私 RAG 与 agentic coding 选型 — whatyathinkk · 2026-09-04
- 双卡 3090 够用吗?本地 LLM 玩家讨论是否再堆两张 — Blues520 · 2026-09-04
- NousResearch 携手 NVIDIA:Hermes Agent 实现一键本地部署 — lifebypixels · 2026-09-04
- 受监管行业求购 AI Gateway:Okta 集成加运行时策略执行 — IrrepressibleInk · 2026-09-04