显卡能跑多少 token/s?一条显存带宽公式帮你估算上限

Pyrolistical · reddit · 2026-09-05

Reddit 网友分享了一套估算本地大模型解码速度(TG/s)的实用方法。核心洞察:解码阶段瓶颈不是算力,而是显存带宽——每生成一个 token 都要把全部模型权重和 KV cache 从显存读一遍。

基础公式(稠密模型):

TG/s = VRAM GB/s ÷ 模型权重 GB

实例演算:Qwen3.8 27B Q4KXL 权重 16.8 GB(剔除 MTP 层与输入嵌入表),AMD Radeon AI PRO R9700 带宽 637 GB/s,理论上限 637/16.8 ≈ 38 TG/s;作者用 llama.cpp 实测 29 TG/s,达到理想值的 76%。

计入 KV cache 后的完整公式:

TG/s = VRAM GB/s ÷ (权重 GB + KV cache GB/token × 上下文长度)

Qwen3.8 27B 的 BF16 KV cache 每 token 约 64 KB。把带宽移到左边,可画出「每 GB/s 带宽的 TG/s vs 上下文长度」曲线,代入自己的显卡即可估算。例如 5090(1.8 TB/s):短上下文上限约 106 TG/s,256k 上下文时降到约 53 TG/s。

注意事项:假设模型与上下文完全在显存内;简化公式仅适用稠密模型(MoE 更复杂);投机解码是额外加速;这些都是理论上限,实际因软硬件栈效率会更低。

所属事件:显存带宽决定推理上限,一条公式估算 token 生成速度(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →