Testing llama.cpp PCIe Bandwidth on Dual GPUs

nick_ziv · reddit · 2026-07-12

This post shares PCIe transfer measurements for dual-GPU local inference using llama.cpp, aiming to determine if multi-GPU setups can use a 1x riser without significantly degrading performance.

Test Environment

Results Comparison

Tensor parallel:

Pipeline parallel (llama.cpp default):

Conclusion

The author concludes:

Original post →

More from Infra

Infra channel →