显存带宽决定推理上限,一条公式估算 token 生成速度
Reddit 网友分享本地大模型解码速度(TG/s)的第一性原理估算方法:解码阶段的瓶颈不是算力而是显存带宽,每生成一个 token,GPU 都要把全部模型权重和 KV 缓存从显存读一遍。对稠密模型,每秒最大 token 数约为显存带宽 B 除以 2N(N 为十亿参数量,按 2 字节计),可快速估算显卡的推理上限。
2026-09-03 ~ 2026-09-05 · 2 条相关
- LLM 推理上限公式:每秒最大 token 数 = 显存带宽 B / 2N — abhijithneil · 2026-09-03
- 显卡能跑多少 token/s?一条显存带宽公式帮你估算上限 — Pyrolistical · 2026-09-05