llama.cpp Adds Cost-Based Tensor Split for 3-4% Speedup on Hybrid Multi-GPUs

milpster · reddit · 2026-08-11

A developer introduced a new cost-based tensor split mode (-sm cost) to llama.cpp, delivering significant inference speedups on specific multi-GPU configurations.

Original post →

More from Infra

Infra channel →