显卡能跑多少 token/s?一条显存带宽公式帮你估算上限
Pyrolistical · reddit · 2026-09-05
Reddit 网友分享了一套估算本地大模型解码速度(TG/s)的实用方法。核心洞察:解码阶段瓶颈不是算力,而是显存带宽——每生成一个 token 都要把全部模型权重和 KV cache 从显存读一遍。
基础公式(稠密模型):
TG/s = VRAM GB/s ÷ 模型权重 GB
实例演算:Qwen3.8 27B Q4KXL 权重 16.8 GB(剔除 MTP 层与输入嵌入表),AMD Radeon AI PRO R9700 带宽 637 GB/s,理论上限 637/16.8 ≈ 38 TG/s;作者用 llama.cpp 实测 29 TG/s,达到理想值的 76%。
计入 KV cache 后的完整公式:
TG/s = VRAM GB/s ÷ (权重 GB + KV cache GB/token × 上下文长度)
Qwen3.8 27B 的 BF16 KV cache 每 token 约 64 KB。把带宽移到左边,可画出「每 GB/s 带宽的 TG/s vs 上下文长度」曲线,代入自己的显卡即可估算。例如 5090(1.8 TB/s):短上下文上限约 106 TG/s,256k 上下文时降到约 53 TG/s。
注意事项:假设模型与上下文完全在显存内;简化公式仅适用稠密模型(MoE 更复杂);投机解码是额外加速;这些都是理论上限,实际因软硬件栈效率会更低。
所属事件:显存带宽决定推理上限,一条公式估算 token 生成速度(2 条相关)→
「Infra」频道最新
- AMD 携手 Cisco 与沙特 HUMAIN 部署 MI335X 集群,规划 250MW — Beth_Kindig · 2026-09-05
- Reef 发布推理原生基础设施:自改进 Agent 边学习边不间断服务 — pliang279 · 2026-09-05
- 从 1D 到 2D int8 量化 GPU kernel,博主分享底层性能跃升 — goyal__pramod · 2026-09-05
- Google DeepMind 推出免费在线书《How To Scale Your Model》讲透 TPU 上 LLM 扩展 — goyal__pramod · 2026-09-05
- 开发者优化 MoE 内核:BF16 提速 1.2 倍,MXFP8 提速 1.6 倍 — retr0jirachi · 2026-09-05
- Google Cloud 用 Cloud Run 沙箱破解编码 agent「修复循环」难题 — rseroter · 2026-09-05