llama.cpp PR adds tensor parallelism across multiple machines via -sm tensor

jacek2023 · reddit · 2026-10-06

A new llama.cpp RPC pull request (#26610 by am17an) adds a -sm tensor split mode enabling tensor parallelism across multiple computers.

This lets a single model be split across several machines for inference, removing single-node VRAM limits — a significant step for running large models locally.

Original post →

More from Infra

Infra channel →