LLM 推理上限公式:每秒最大 token 数 = 显存带宽 B / 2N
abhijithneil · x · 2026-09-03
作者给出 LLM 推理速度的第一性原理估算:生成每个 token 时,GPU 必须把模型的全部权重从显存读一遍——对稠密模型没有捷径。N 十亿参数按 2 字节算,每 token 需读取 2N GB,因此理论上限为 max tokens/s = B / 2N(B 为 GPU 显存带宽)。实际工程目标就是逼近这个上限的百分比,这为评估推理优化收益提供了基准。
「Infra」频道最新
- 一张图看懂 CPU/GPU/TPU/NPU/LPU 五种 AI 芯片架构取舍 — Roger_M_Taylor · 2026-09-03
- llama.cpp 连发三个 Metal MoE 优化 PR,M5 上解码提速 12% — predatar · 2026-09-03
- Ex-Tesla 高管解析:一颗碳化硅器件如何挡下 1 万伏电压 — wandb · 2026-09-03
- 微软 Azure 发文拆解 Agent 优化的经济学账 — adnan_hashmi · 2026-09-03
- 本地数据中心≠主权AI:1024卡集群年耗水超3000万升 — Arc_bong · 2026-09-03
- 求 LLM 推理学习资源:投机解码该去哪学? — metalvendetta · 2026-09-03