像素扩散模型冻结主干也能自我引导:用合成样本训适配器,FID 最高降超 50%

A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples

Zixuan Fu, Chong Wang, Lanqing Guo, Kailai Zhou, Jiahao Nie, Bihan Wen

cs.CV

2026-07-31

像素扩散模型不必重训:在中间层挂轻量适配器、用模型自产的合成图训练,采样时用中间层与最终层预测差做自引导,算力不到全量 1%,无 CFG 时 FID 降超 50%。

这篇在解决什么

像素扩散模型直接在原始像素空间生成图像,不走 latent diffusion(Stable Diffusion 那套先用 VAE 压到隐空间的路线)。省了一步,代价是更难:同一个模型要在同一个高维空间里同时抓住全局结构和局部高频纹理,而像素扩散偏偏欠拟合高频细节,生成的图纹理偏糊。

已有改进换预测目标(改成预测干净图像)、加感知损失、做表征对齐、上分层架构,但都得从头训一个新模型,很贵。问题来了:能不能不重训,用很便宜的代价把一个已经训好的像素扩散模型再提一档?

方法

核心观察来自频域分析:在像素扩散 transformer 里,中间层解出来的预测是粗糙的低频结构(全局骨架),最终层才逐步补上高频的局部细节。

SSG(合成自引导)就建在这上面。给某个中间层(JiT 上是第 4–6 层)挂一个轻量预测头(适配器),主干全程冻结。采样时,引导后的预测等于:中间层预测 + 引导系数 ×(最终层预测 − 中间层预测)。系数为 1 时还原原输出,大于 1 就往偏离粗糙预测的方向外推,放大最终层补的那些高频细节。它像 classifier-free guidance(CFG),但不需要类别标签,是模型拿自己的中间状态引导自己。

最反直觉的是训练:适配器不用真实图像训,而用模型自己生成的合成图训(默认 100 万张),而且合成图训出来比真图更好。原因是合成样本贴合模型自身的分布,正好放大它欠拟合的高频成分。整个适配器训练算力不到全量训练的 1%,参数只多约 1200 万。更绝的是数据量不敏感:从 100 万张砍到 1 万张(缩 100 倍),FID 变化不到 0.05,说明它学的是一个固定的频域修正,不是在背数据。

结果

在 ImageNet 类条件生成上:

设置基线 FID+SSG FID
JiT-H/16(有 CFG,256)1.861.67
PixelREPA-H/16(有 CFG)1.811.59
JiT-H/16(无 CFG)7.152.26
JiT-B/16(无 CFG)25.429.47

有 CFG 时是锦上添花(约 0.1–0.2 的稳定提升),无 CFG 时是质变(降超 50%)。合成图训练(1.67)还压过真图训练(1.78)。对比其他像素空间 SOTA,PixelREPA-H/16+SSG 的 1.59 优于 PixelU-H/16(1.63)、PixelDiT-XL(1.61);也比联合训练的 Internal Guidance 更好(SSG 3.29 vs JiT+IG 3.41)。

为什么重要

对扩散模型圈,这是一条真正便宜的路:冻结主干、不到 1% 算力、多 1200 万参数,就能把 SOTA 像素扩散模型再往前推。「合成图胜过真图」这点既反直觉又好用,意味着你不需要原始训练数据,拿模型自己的采样就能训。对从业者要清醒的是:它只在类条件 ImageNet 的像素扩散上验证过,还没碰文本生成图和 latent diffusion(这才是当下的生产主力),所以眼下能直接用上的场景偏窄。

局限与存疑

作者承认:只在类条件 ImageNet 上做,能否推广到更大的文本条件模型或别的图像分布,还不清楚。

更值得追问的是:对数据量完全不敏感(1 万张约等于 100 万张),恰恰说明适配器学的是一个固定的频域修正变换,这也解释了它为什么又便宜又通用,但同时它的天花板可能也就这么高。无 CFG 的大涨有一部分是因为无 CFG 基线本身太弱,有 CFG 时提升就温和得多。而且整篇只有 FID 这类分布指标,没有人评或下游任务证据,说明那些被锐化的高频细节到底是视觉上更真实,还是只是更讨 FID 喜欢,还没被验证。

术语

原文与代码

相关论文

全部论文解读