显存带宽决定推理上限,一条公式估算 token 生成速度

Reddit 网友分享本地大模型解码速度(TG/s)的第一性原理估算方法:解码阶段的瓶颈不是算力而是显存带宽,每生成一个 token,GPU 都要把全部模型权重和 KV 缓存从显存读一遍。对稠密模型,每秒最大 token 数约为显存带宽 B 除以 2N(N 为十亿参数量,按 2 字节计),可快速估算显卡的推理上限。

2026-09-03 ~ 2026-09-05 · 2 条相关