扩散模型研究反思:评测指标陈旧与架构强耦合隐患
kalomaze 近期针对扩散模型领域的研究现状提出多项批评,指出当前研究在评测体系、架构设计和底层稳定性上均存在盲点,呼吁社区不要被好看的理论或单一指标误导。
评测指标陈旧且易被操纵
他首先指出,视频扩散和世界模型领域的讨论仍在大量使用过时的评测工具,例如依赖发布于 2015 年的 Inception-v3 特征提取器。扩散模型研究常把 ImageNet FID 当作唯一的“梗指标”来刷分,导致出现“能刷指标就行”的怪象。他认为,如果研究问题本身设计得更扎实,就不会如此依赖这些容易被刷爆的代理指标。
架构强耦合与理论掩盖问题
在架构设计上,kalomaze 认为绝大多数公开基线把“负责去噪的网络”和“负责深层理解的网络”强行绑定在一起。他主张将两者解耦:用便宜的去噪器去条件化大模型输出的确定性向量,从而把昂贵的推理计算留给真正的理解任务。此外,他批评 SD3 依赖某种“伪启发式权重”,掩盖了 vanilla flow matching 本身条件数(condition number)很差的问题。这也印证了他“条件差的重参数化即使理论好看也未必有用”的观点。
底层稳定性与世界模型误差
除了架构与评测,他还指出了扩散模型在具体应用中的数值隐患。例如,SDXL VAE 的 latent 分布图显示,即使 autoencoder 是专为扩散模型训练的,其 latent 值也并非天然稳定,SD3 就可能隐藏了不稳定数值。在世界模型应用方面,引用 DIAMOND 的结果说明,基于 DDPM 的世界模型存在严重的误差累积,相比之下 EDM 在 n=1 时表现得更稳定,这意味着 DDPM 并不适合对生成正确性有高要求的任务。
2026-07-23 ~ 2026-07-23 · 7 条相关
- 【源头】视频扩散仍在依赖八到十一年前的评测指标 — kalomaze · 2026-07-23
- 扩散模型研究仍大量依赖可被刷爆的 ImageNet FID 指标 — kalomaze · 2026-07-23
- kalomaze:扩散模型基线把去噪与理解强行绑在一起 — kalomaze · 2026-07-23
- 【源头】研究讨论:没有经验收益的漂亮重参数化未必有用 — kalomaze · 2026-07-23
- SD3 被批掩盖了 flow matching 的条件数问题 — kalomaze · 2026-07-23
- SDXL VAE latent 分布图显示扩散模型仍会藏不稳定值 — kalomaze · 2026-07-23
- 【源头】DIAMOND 显示 DDPM 世界模型误差累积,EDM 在 n=1 仍更稳 — kalomaze · 2026-07-23