LDM-is-AE 论文:把 DiT 当自编码器,去掉预训练 VAE,ImageNet FID 达 1.80
serrjoa · x · 2026-09-30
Latent Diffusion Models 传统上采用两阶段训练:先预训练自编码器(VAE)定义潜空间,再在其中训练去噪扩散模型,这导致潜空间为重建优化、与去噪动态不匹配。
核心思路
- 论文指出 LDM 本身就是一个自编码器:DiT 主干在每个去噪步骤实际执行潜变量→特征→潜变量的变换,可视为内建的解码-编码过程。
- 据此将 DiT 主干拆成 DiT-E(编码)与 DiT-D(解码)两个互逆组件,并在所有时间步对中间特征施加图像空间监督,建立显式的 latent→image→latent 路径。
- 模型因此能端到端联合学习潜表示与去噪,完全省去单独训练的 tokenizer(VAE)。
结果:在 ImageNet 图像生成上取得 FID 1.80,优于传统两阶段方案。论文作者包括 Zhengqiang Zhang、Lei Zhang 等(arXiv:2609.37080)。
「研究」频道最新
- ProDyGS:用单视图新视角合成伪造多视角,单目动态高斯重建 — kwangmoo_yi · 2026-09-30
- 从 PDF 存档到可训练模型:一套可复用的开源微调数据工作流 — Puzzleheaded_Box2842 · 2026-09-30
- 深度或是下一条 Scaling 轴,前提是选对残差连接 — FinanceYF5 · 2026-09-30
- 破解「深度诅咒」:Kimi K3、DeepSeek V4 各押注不同残差方案 — FinanceYF5 · 2026-09-30
- 「痛觉轴」论文被滥用:有人 amplify 模型痛觉方向称建「AI 刑房」 — ZeroStateReflex · 2026-09-30
- 不靠 RL 和验证器,用模型自身解释训练 agent 反而提升编码能力 — CatAstro_Piyush · 2026-09-30