Foundations of Diffusion Models in General State Spaces: A Self-Contained Introduction
Vincent Pauline, Tobias Höppe, Kirill Neklyudov, Alexander Tong, Stefan Bauer, Andrea Dittadi
stat.ML, cs.LG
2025-12-05
把高斯与类别扩散收进同一马尔可夫框架:固定前向加噪、学反向、ELBO训练;连续极限SDE,离散极限CTMC。
扩散模型的入门材料几乎都默认数据在欧氏空间里:像素是实数,加噪是高斯。文本、分子、类别标签这类离散对象被另一套论文单独处理,两边的记号、损失、采样器对不上。
更早的层级 VAE 已经在用多层隐变量做生成,但训练时要逐步仿真整条推断链,中间边缘分布不可辨识,简单参数族能不能扛住条件分布也不清楚。Sohl-Dickstein 等人 2015 年的关键一步是把前向加噪过程固定下来。这篇 TUM、Helmholtz AI、MCML 与 Mila 合写的长文把那一步展开成一份自洽教程:连续状态和离散状态从离散时间写到连续时间极限,再用无穷小生成元收成一套。
统一配方只有三步。
前向过程按坐标独立加噪,所以可以在单维上分析。反向过程必须重建数据里的相关结构,网络看到的是整个噪声状态,再逐维给出反向参数。
连续侧,一步转移是信号系数 \(\alpha\) 与噪声 \(\sigma\) 的凸组合。步数 \(T\) 趋于无穷时,离散更新收敛到 SDE:漂移是 \((\mathrm{d}\log\alphat/\mathrm{d}t)\,xt\),扩散系数满足 \(gt^2=\alphat^2\,\mathrm{d}/\mathrm{d}t(\sigmat^2/\alphat^2)\)。反向 SDE 在漂移里补上 \(g^2\nabla\log q\),这就是 score。把扩散项全部吸进漂移,得到概率流 ODE。
离散侧,转移矩阵同样写成「保留原 token + 重采样到参考分布」的凸组合。参考分布可以是均匀、吸收态 [MASK]、或二者混合。连续时间极限是 CTMC,瞬时行为由速率矩阵 \(Rt\) 给出:非对角非负、每列和为零。反向 CTMC 用当前边缘概率把正向速率拧过来。
mask 扩散更窄:前向只允许 token 跳到 [MASK]。把 ELBO 里与参数无关的项丢掉之后,训练目标收回带时间权重 \(\alpha't/(1-\alphat)\) 的掩码语言模型损失,只在被 mask 的位置上预测原 token。
第 7 节用无穷小生成元 \(\mathscr{L}t\) 一笔写完两边。它对测试函数描述局部期望如何瞬时变化,伴随算子给出 Kolmogorov 前向方程,同时管 SDE 的 Fokker-Planck 和 CTMC 的 master equation。这条路还能接到跳跃扩散。第 8 节把扩散搬进学习到的隐空间,并综述把离散数据嵌进连续扩散,以及 Duo、CADD、CCDD 这类连续-离散耦合。
这是教程,没有新的生成 SOTA 数字。能核对的是几条可计算的恒等式。
| 设定 | 前向极限 | 训练目标收成什么 | ||
| 连续、高斯 | SDE | \(\frac12\int gt^2\ | \nabla\log q(xt\mid x0)-s\theta\ | ^2\mathrm{d}t\) |
| 离散、吸收 / mask | CTMC | 加权 MLM,权重 \(\alpha't/(1-\alphat)\) | ||
| 两边 | 生成元 \(\mathscr{L}t\) | 路径测度上的同一条 ELBO |
离散时间高斯或类别前向都给出闭式 \(q(xt\mid x0)\),训练不必仿真整条加噪链。连续时间里重建项 \(\mathcal{L}0\) 趋于 0,可忽略。
只做过 DDPM 或 score SDE 的人,这是进入离散扩散最短的对照读法:Gaussian kernel 对上 categorical kernel,score 对上反向速率。如果在做 mask 扩散语言模型,它解释了损失为什么长得像 BERT 的 MLM,以及那个时间权重从哪来。
生成元视角是给后面用的。真要做跳跃扩散或分段确定性过程,SDE 记号不够,算子记号够。
它不是方法论文。没有新骨架,没有 FID 或 perplexity 对照。读完不会立刻快一个采样器。
工程部分被明确划出范围:网络结构、采样加速、噪声日程调参都不讲。反向过程按维因子分解是近似,真反向并不因子分解。可变长度(插入、删除,Levenshtein 风格)只点到文献,没有与固定长度 substitution 同等展开。第 8 节引用的 Duo、CADD、CCDD 是 2025 年的工作,文中当路线图,不是本文实验。生成元推导依赖正则性,离散高维序列上伴随算子那套函数空间条件在实现里通常被默认成立。