torch.compile 遇 FSDP 动态形状训练致 MFU 下降
开发者在训练 Flux.2 klein 图像模型时发现,torch.compile 在 dynamic shape=True 且使用 FSDP 并行策略时,会自动跳过对 FSDP 包装模块安装 guards。原因是 FSDP1 的遗留逻辑仍被应用于 FSDP2,故意跳过 guards 导致生成更多符号参数,使 LayerNorm、RoPE 等逐元素算子难以融合,最终造成 MFU(模型算力利用率)显著降低。
2026-08-24 ~ 2026-08-24 · 3 条相关
- PyTorch 编译陷阱:FSDP 导致 MFU 下降 — SeunghyunSEO7 · 2026-08-24
- torch.compile 在 FSDP 动态形状训练下因跳过 Guard 导致 MFU 降低 — SeunghyunSEO7 · 2026-08-24
- FSDP 旧版跳过 guards 导致算子融合困难 — SeunghyunSEO7 · 2026-08-24