Rethinking Diffusion Models: Outdated Metrics and Forced Architecture Coupling

kalomaze 近期针对扩散模型领域的研究现状提出多项批评,指出当前研究在评测体系、架构设计和底层稳定性上均存在盲点,呼吁社区不要被好看的理论或单一指标误导。

评测指标陈旧且易被操纵

他首先指出,视频扩散和世界模型领域的讨论仍在大量使用过时的评测工具,例如依赖发布于 2015 年的 Inception-v3 特征提取器。扩散模型研究常把 ImageNet FID 当作唯一的“梗指标”来刷分,导致出现“能刷指标就行”的怪象。他认为,如果研究问题本身设计得更扎实,就不会如此依赖这些容易被刷爆的代理指标。

架构强耦合与理论掩盖问题

在架构设计上,kalomaze 认为绝大多数公开基线把“负责去噪的网络”和“负责深层理解的网络”强行绑定在一起。他主张将两者解耦:用便宜的去噪器去条件化大模型输出的确定性向量,从而把昂贵的推理计算留给真正的理解任务。此外,他批评 SD3 依赖某种“伪启发式权重”,掩盖了 vanilla flow matching 本身条件数(condition number)很差的问题。这也印证了他“条件差的重参数化即使理论好看也未必有用”的观点。

底层稳定性与世界模型误差

除了架构与评测,他还指出了扩散模型在具体应用中的数值隐患。例如,SDXL VAE 的 latent 分布图显示,即使 autoencoder 是专为扩散模型训练的,其 latent 值也并非天然稳定,SD3 就可能隐藏了不稳定数值。在世界模型应用方面,引用 DIAMOND 的结果说明,基于 DDPM 的世界模型存在严重的误差累积,相比之下 EDM 在 n=1 时表现得更稳定,这意味着 DDPM 并不适合对生成正确性有高要求的任务。

2026-07-23 ~ 2026-07-23 · 7 related posts