推主连载科普 LLM 推理指标:TTFT、TPS、TPOT 到底在测什么
abhijithneil · x · 2026-09-04
@abhijithneil 正在连载 LLM 推理入门系列,本段解释常见性能指标:
- TTFT(首 token 时间):从发出请求到看到第一个词的耗时,主要是 prefill 时间加上排队等待
- Prefill:模型读取 prompt,所有 prompt token 并行一次性处理,单 token 速度快、GPU 负载高;prompt 越长 prefill 越长
- Decode:模型逐 token 生成答案,因为每个 token 依赖前一个 token 的存在;这是大部分挂钟时间的去向
适合想理解推理性能指标含义的读者作快速入门。
所属事件:科普线程讲透 LLM 推理指标:TTFT、TPS 与 TPOT(4 条相关)→
「Infra」频道最新
- AMD 发布 Threadripper Halo Station:96 核 CPU 配 576GB HBM3E — ccerrato147 · 2026-09-04
- 流体基础模型 AeroJEPA 正式加入 NVIDIA PhysicsNeMo 生态 — ricardovinuesa · 2026-09-04
- 2-2.5千欧预算搭建本地 AI 工作站:律师隐私 RAG 与 agentic coding 选型 — whatyathinkk · 2026-09-04
- 双卡 3090 够用吗?本地 LLM 玩家讨论是否再堆两张 — Blues520 · 2026-09-04
- NousResearch 携手 NVIDIA:Hermes Agent 实现一键本地部署 — lifebypixels · 2026-09-04
- 受监管行业求购 AI Gateway:Okta 集成加运行时策略执行 — IrrepressibleInk · 2026-09-04