TPOT 20 毫秒即每秒 50 token:一条线程讲透推理速度指标
abhijithneil · x · 2026-09-04
一条科普线程解释 LLM 推理服务的核心性能指标:
- TPOT(time per output token,又称 ITL,inter-token latency):首 token 之后每个 token 之间的间隔,即流式输出的速度。
- 单用户 TPS = 1 / TPOT。若 TPOT 为 20 毫秒,用户实际看到每秒 50 个 token。
- 系统 TPS 是服务器为所有用户产生的总 token 速率:100 个用户各拿 50 token/s,系统总吞吐就是 5000。
线程强调区分「单用户体验速度」与「系统总吞吐」两个视角,是理解推理服务容量规划的基础概念。
所属事件:科普线程讲透 LLM 推理指标:TTFT、TPS 与 TPOT(4 条相关)→
「Infra」频道最新
- Spotify 工程团队用 Portal 路由策略,砍掉 90% Claude Code token — rseroter · 2026-09-04
- 开源桌面工作台 Vyact:本地模型+文档 RAG+浏览器上下文一站集成 — vyact · 2026-09-04
- KV 量化在多深上下文开始劣化?F16 vs Q8/Q4 序列对齐 PoC — Slight_Analysis_5414 · 2026-09-04
- KV 缓存:自回归 LLM 推理的根基性优化,用内存换算力 — alec_helbling · 2026-09-04
- WSJ:数据中心让路易斯安那小县居民「集体中彩票」 — robleclerc · 2026-09-04
- 无编排器无 MCP:4 个对等 Agent 通过 gossip 组网完成真实调研任务 — Trainer_Intelligent · 2026-09-04