Padding trick lets vLLM run tp=6: 27B model at 50 tok/s on six 7900 XTX GPUs

Biomass23 · reddit · 2026-10-01

A user shares a practical vLLM trick: tensor parallel normally requires model dimensions divisible by GPU count (power-of-two setups). By writing a converter that zero-pads the model until all required numbers divide by 6, they run a Qwen 27B model at BF16 with 256k context across six 7900 XTX GPUs.

Results:

A directly reproducible approach for non-power-of-two GPU counts wanting maximum KV cache.

Original post →

More from Infra

Infra channel →