CompVis 改进分布扩散模型,ImageNet 上 4 步采样达 4.48 FID
CompVis · hf · 2026-09-30
CompVis 发布 Improved Distributional Diffusion Models(iDDM)。分布扩散模型(DDM)用基于 scoring rule 的分布式去噪器替代传统的均值预测去噪器,但此前难以扩展到现代图像生成设置:多粒子训练开销随粒子数线性增长,且全局固定的 scoring rule 超参数无法适配不同采样预算。
本文的改进包括:将粒子扩展推迟到 transformer 后期层,并借鉴 Biroli 2024 的动力学机制引入随时间变化的 scoring rule 调度。结合 DiT 潜空间设置,在 ImageNet-256² 上从零单阶段训练(无需教师、自蒸馏或 JVP),DiT-XL/2 达到 4 步 4.48 FID、50 步 2.38 FID,且 FID 不随采样预算从 4 到 50 NFE 增长而退化。该方案同样可迁移到文生图。代码与模型已开源。
「多模态」频道最新
- Runway 教程:一张产品图自动生成全渠道广告素材库 — tlakomy · 2026-09-30
- Pencil0 私测:一句话生成完整电影,AI 电影智能体亮相 — yihui_indie · 2026-09-30
- SoL-Refiner 一步去噪把低清视频拉到 2K/4K,端到端快 8.91 倍 — linoy_tsaban · 2026-09-30
- 周末实验:给文字浇水,用 AI 长出永不重复的俳句 — AI_Andrew · 2026-09-30
- 把照片视频重建成可穿行的4D场景,他提出「空间记忆宫殿」 — bilawalsidhu · 2026-09-30
- AA 文生视频榜 v2.0 发布:Wan 3.0 居首,MiniMax H3 性价比突出 — ArtificialAnlys · 2026-09-30