LDM-is-AE 论文:把 DiT 当自编码器,去掉预训练 VAE,ImageNet FID 达 1.80

serrjoa · x · 2026-09-30

Latent Diffusion Models 传统上采用两阶段训练:先预训练自编码器(VAE)定义潜空间,再在其中训练去噪扩散模型,这导致潜空间为重建优化、与去噪动态不匹配。

核心思路

结果:在 ImageNet 图像生成上取得 FID 1.80,优于传统两阶段方案。论文作者包括 Zhengqiang Zhang、Lei Zhang 等(arXiv:2609.37080)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →