LLM 推理上限公式:每秒最大 token 数 = 显存带宽 B / 2N

abhijithneil · x · 2026-09-03

作者给出 LLM 推理速度的第一性原理估算:生成每个 token 时,GPU 必须把模型的全部权重从显存读一遍——对稠密模型没有捷径。N 十亿参数按 2 字节算,每 token 需读取 2N GB,因此理论上限为 max tokens/s = B / 2N(B 为 GPU 显存带宽)。实际工程目标就是逼近这个上限的百分比,这为评估推理优化收益提供了基准。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →