流式推理指标科普:TPOT 即 token 间延迟,决定生成速度
abhijithneil · x · 2026-09-04
作者在推文线程里科普 LLM 服务的关键延迟指标:
- TTFT (time to first token):从发出请求到看到第一个词出现的时间,主要由 prefill 时间加上排队等待构成。
- TPOT (time per output token):首个 token 之后每个 token 之间的间隔,也就是流式输出速度,有时写作 ITL(inter-token latency),两者是同一回事。
- TPS:每秒输出 token 数。
这组指标是评估推理服务体验的基础口径,作者以连载形式逐条解释。
所属事件:科普线程讲透 LLM 推理指标:TTFT、TPS 与 TPOT(4 条相关)→
「Infra」频道最新
- Spotify 工程团队用 Portal 路由策略,砍掉 90% Claude Code token — rseroter · 2026-09-04
- 开源桌面工作台 Vyact:本地模型+文档 RAG+浏览器上下文一站集成 — vyact · 2026-09-04
- KV 量化在多深上下文开始劣化?F16 vs Q8/Q4 序列对齐 PoC — Slight_Analysis_5414 · 2026-09-04
- KV 缓存:自回归 LLM 推理的根基性优化,用内存换算力 — alec_helbling · 2026-09-04
- WSJ:数据中心让路易斯安那小县居民「集体中彩票」 — robleclerc · 2026-09-04
- 无编排器无 MCP:4 个对等 Agent 通过 gossip 组网完成真实调研任务 — Trainer_Intelligent · 2026-09-04