Diffusers TP 分片加载 PR 细节:边读边切分省 89% CPU 内存
RisingSayak · x · 2026-10-01
作者致谢 JingyaHuang 合并了 Diffusers 张量并行分片加载的核心 PR(#14544)。该 PR 使 .frompretrained() 在读取时按 tpplan 切分权重,每个 rank 只读自己那份、直接生成设备上的 DTensor,不再需要全量加载后重新切分;.savepretrained() 也支持 TP 感知保存。devicemap、量化、flashpack、DDUF 及非 safetensors 格式暂不支持并会报错。
所属事件:Diffusers 张量并行加载升级,Flux.2-Dev 提速 2.4 倍(2 条相关)→
「Infra」频道最新
- 图解案例:Canva 如何在云成本上省下数百万美元 — _jaydeepkarale · 2026-10-01
- tilelang 开源 DSL 让 GPU/加速器内核开发更简单,已有 7973 stars — tile-ai · 2026-10-01
- 贝恩测算:AI 公司到 2031 年每年需 4.2 万亿美元新营收支撑数据中心 — ylecun · 2026-10-01
- AWS 向量服务用着痛,开发者转向开源 Weaviate 求扩展方案 — CShorten30 · 2026-10-01
- Nebius 收购 Inferize,瞄准推理平台的 GPU 空转税 — demian_ai · 2026-10-01
- 一张时间表勾勒 AI 基建周期:2026 大建设,2030 后赌需求变现 — AntDX316 · 2026-10-01