11 步手推变分自编码器,一笔画懂 KL 散度与重构损失
ProfTomYeh · x · 2026-09-15
Tom Yeh 以手写演算方式分 11 步讲解 VAE(变分自编码器)的完整前向与梯度推导:
- 核心思想:VAE 学习数据本身的隐含结构(每个隐特征的均值 μ 与标准差 σ),再从这个分布采样生成新数据;而 GAN 只学会骗过判别器,可以在不理解数据构成的情况下造出以假乱真的样本——这是 VAE 的价值所在。
- 推导脉络:从三个训练样本出发,编码器两层映射出 μ 和 σ;用重参数化技巧(ε·σ + μ)让梯度能穿过采样步骤;解码器两层重建输入 X。
- 关键梯度:KL 项的梯度经 SGVB 估计器化简后就是 μ 本身(推向 0),σ 的梯度是 σ − 1/σ(推向 1),重构项的梯度是 Y − X(均方误差)。
- 妙处:这两个梯度恰好是两个现代方法的核心——KL 散度正是 RLHF 中 GRPO 等方法防止微调模型偏离基座模型的惩罚项,而重构损失(MSE)正是训练扩散模型去噪的损失。手推一遍 VAE 就同时掌握了两者。
文中提到该 VAE 论文《Auto-Encoding Variational Bayes》(Kingma & Welling)于 2024 年获 ICLR 首届时间检验奖。
「研究」频道最新
- World Mechanics 组建创始研究团队,让可解释性成为物理 AI 预训练起点 — soniajoseph_ · 2026-09-15
- 微生物学冷知识示例:CIDT 阳性后样本送检的正确顺序 — soumitrashukla9 · 2026-09-15
- 机器人新品扎堆,作者推荐重读策略评估最佳实践论文 — eigenron · 2026-09-15
- MolmoSpaces 基准发布:GPT-Astra 零样本超越全部开源 VLA 基线 — notmahi · 2026-09-15
- 蛋白质设计新综述:用更少氨基酸维持结构与功能 — KevinKaichuang · 2026-09-15
- Wayve 研究员:机器人领域难现颠覆性目标函数,仍是下 token 预测变体 — m_wulfmeier · 2026-09-15