Diffusers PR #14544: shard tensor-parallel checkpoints on load and save

RisingSayak · x · 2026-10-01

The follow-up to Diffusers' tensor parallelism support: PR #14544 by JingyaHuang makes frompretrained(..., parallelconfig=...) shard weights while reading, so each rank loads only its own slice straight into a DTensor on device, and savepretrained() is TP-aware. Unsupported combos (devicemap, quantization, flashpack, DDUF, non-safetensors) raise errors.

Related event: Diffusers Tensor Parallel Loading Gets Major Speedup(2 posts)→

Original post →

More from Infra

Infra channel →