Diffusers TP 分片加载 PR 细节:边读边切分省 89% CPU 内存

RisingSayak · x · 2026-10-01

作者致谢 JingyaHuang 合并了 Diffusers 张量并行分片加载的核心 PR(#14544)。该 PR 使 .frompretrained() 在读取时按 tpplan 切分权重,每个 rank 只读自己那份、直接生成设备上的 DTensor,不再需要全量加载后重新切分;.savepretrained() 也支持 TP 感知保存。devicemap、量化、flashpack、DDUF 及非 safetensors 格式暂不支持并会报错。

所属事件:Diffusers 张量并行加载升级,Flux.2-Dev 提速 2.4 倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →