扩散模型生成图像有相变:类别在临界噪声瞬间定下,细节全程平滑演化

A Phase Transition in Diffusion Models Reveals the Hierarchical Nature of Data

Antonio Sclocchi, Alessandro Favero, Matthieu Wyart

stat.ML, cond-mat.dis-nn, cs.CV, cs.LG

2024-02-27

证明扩散模型有相变:越过临界噪声,图像类别复原概率突降到随机,低层细节却平滑变化;ImageNet 上类别在 t≈T/2 陡降。

这篇在解决什么

扩散模型能生成高质量图像,但它到底在反扩散的每一步干什么,一直说不清。一个直觉是:自然数据(图像、语言)是层级组合的,高层特征(这是什么)和低层特征(具体长什么样)不在一个层面。这篇要回答:扩散过程的不同时刻,是不是对应数据层级的不同深度?

方法

作者用一个可解析的层级生成模型(Random Hierarchy Model,RHM)当数据:一个类标签逐层展开成特征、子特征,直到最底层的像素级 token,树深 L、分支 s、词表 v。然后推导:给定当前噪声水平,后向扩散(从噪声逐步还原成样本的过程)能把多高层级的特征复原出来。

他们把「能否判断原始类别」建模成消息沿树向上的迭代,得到一个不动点方程。关键参数 sf(每层的有效分支比)决定是否存在相变。具体说,他们追踪自底向上消息保持类别一致的概率 p,它在树上每一层按一个函数 F(p) 迭代;F 的不动点结构决定结局,有两个吸引不动点(p=1 和 p=1/v)加一个排斥不动点时出现相变,只剩两个不动点时类别不可恢复。

结果

理论给出一个临界噪声 ε(对应临界时刻 t):

高层特征(类别)在 t 处阶跃式崩塌,低层特征(纹理、局部细节)则全程平滑变化。

在 ImageNet 上训了一个无类别条件的 DDPM,用 ConvNeXt-Base 做探针(top-5 准确率 96.9%),对一万张图测初始图与生成图在各层激活的余弦相似度。结果是:类别相似度在 t≈T/2(一千步里的约 500 步)陡降,而低层相似度一直平滑。越过相变后生成图换了类别,但仍可能复用原图的低层元素,比如豹子的眼鼻耳被重组成狼。

为什么重要

它把「扩散模型在不同噪声水平做不同层级的事」从一个比喻变成了可证伪的相变论断。对从业者,这意味着调度噪声、分层控制生成(先定类别再填细节)有了理论依据,而不只是经验。

局限与存疑

RHM 是玩具数据,真实图像的层级结构远比固定树复杂。相变时刻 t 依赖模型和数据,论文只在 ImageNet 一个设置上验证了 t≈T/2。无类别条件下的结论能不能直接搬到带文本条件的文生图(那里 prompt 取代了类别),还没有答案。

术语

原文与代码

社区讨论

相关论文

全部论文解读