CompVis 改进分布扩散模型,ImageNet 上 4 步采样达 4.48 FID

CompVis · hf · 2026-09-30

CompVis 发布 Improved Distributional Diffusion Models(iDDM)。分布扩散模型(DDM)用基于 scoring rule 的分布式去噪器替代传统的均值预测去噪器,但此前难以扩展到现代图像生成设置:多粒子训练开销随粒子数线性增长,且全局固定的 scoring rule 超参数无法适配不同采样预算。

本文的改进包括:将粒子扩展推迟到 transformer 后期层,并借鉴 Biroli 2024 的动力学机制引入随时间变化的 scoring rule 调度。结合 DiT 潜空间设置,在 ImageNet-256² 上从零单阶段训练(无需教师、自蒸馏或 JVP),DiT-XL/2 达到 4 步 4.48 FID、50 步 2.38 FID,且 FID 不随采样预算从 4 到 50 NFE 增长而退化。该方案同样可迁移到文生图。代码与模型已开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →