零填充让 vLLM 跑 tp=6:6 卡跑 27B 模型实测 50 tok/s

Biomass23 · reddit · 2026-10-01

作者分享了一个 vLLM 实用技巧:vLLM 的张量并行通常要求模型架构参数能被 GPU 数整除,一般只能用 2/4/8 卡。他提出用零填充转换器把模型参数补齐到能被 6 整除,从而在 6 张 7900 XTX 上跑 Qwen 27B(BF16、256k 上下文)。

实测结果:

对于非 2 的幂次卡数想最大化 KV cache 的用户,这是个可直接复制的做法。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →