零填充让 vLLM 跑 tp=6:6 卡跑 27B 模型实测 50 tok/s
Biomass23 · reddit · 2026-10-01
作者分享了一个 vLLM 实用技巧:vLLM 的张量并行通常要求模型架构参数能被 GPU 数整除,一般只能用 2/4/8 卡。他提出用零填充转换器把模型参数补齐到能被 6 整除,从而在 6 张 7900 XTX 上跑 Qwen 27B(BF16、256k 上下文)。
实测结果:
- 单用户生成速度约 50 tok/s,8 路并发合计约 200 tok/s
- GPU KV cache 达 520,784 tokens,262k token 请求的并发能力约 1.99x
对于非 2 的幂次卡数想最大化 KV cache 的用户,这是个可直接复制的做法。
「Infra」频道最新
- 巴拉圭将建120亿美元AI城,规划拉美最大超大规模数据中心 — teortaxesTex · 2026-10-01
- You.com 携手 NVIDIA 把实时搜索引入 RL 训练,首个用于 Nemotron 3.5 Lightning — RichardSocher · 2026-10-01
- 为省推理成本,Bittensor Chutes 团队或发现全新模型训练方式 — markjeffrey · 2026-10-01
- Ornith-1.5 配套 DFlash 草稿模型上线,最高 2.54 倍无损加速 — alan_ritter · 2026-10-01
- 经理锁死 Teams 会议记录,员工借 Copilot 从源码里捞回转录 — TheBigCrowbroski · 2026-10-01
- 算力横向对比:Nvidia 仍是性价比最优硬件 — Storge2 · 2026-10-01