Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration
Jiaqi Han, Juntong Shi, Puheng Li, Haotian Ye, Qiushan Guo, Stefano Ermon
CVPR 2026
cs.CV, cs.LG
2026-03-02
无需重训,只在采样时缓存 Transformer 最后一层特征、用切比雪夫多项式外推,FLUX.1 提速 4.79 倍且 PSNR 反超 TaylorSeer 近 5 分。
扩散模型(Diffusion)生成一张图、一段视频要跑几十步去噪,每步都是一次完整的网络前传,慢。一类叫「特征缓存加速」的办法利用了相邻去噪步的特征变化平缓:跳过部分步的网络前传,用前面算过的特征凑出被跳过的部分,等效减少前传次数(NFE)。代表方法 TaylorSeer 用泰勒展开预测被跳过的特征,但它有个毛病,误差随步长放大,步子迈大了画面就糊。核心矛盾是要么少省(小步)、要么糊(大步)。
Spectrum 的观察是:在网络某一层,特征的每个通道随去噪时间 t 的变化曲线其实很平滑,可以用低阶多项式拟合。它不用泰勒(泰勒误差与步长的高次幂挂钩),改用切比雪夫多项式(Chebyshev polynomial)做岭回归拟合,误差上界只取决于多项式阶数,不随步长放大。
具体做法:
这套机制同时适用于 DiT(FLUX、Wan、HunyuanVideo、SD3)和 U-Net 结构的 SDXL,说明它绑的是「特征随时间平滑」这个性质,不绑具体主干。
10 次 NFE 换来约 4.5 到 4.8 倍提速,14 NFE 约 3.5 倍。
| 模型 | 提速 | 质量(PSNR/dB) | 对照 TaylorSeer |
| FLUX.1 | 4.79× | 22.21 | 17.41 |
| Wan2.1-14B | 4.67× | 21.24 | 17.24 |
| HunyuanVideo | 4.56× | 25.39 | — |
| SD3.5-Large | 4.32× | — | — |
相比「真值」特征的 RMSE,Spectrum 比 TaylorSeer 低 2 到 3 倍。Wan2.1-14B 在 VBench 上仍拿到 82.21。关键在于它在大步长下不崩,TaylorSeer 在同样提速比下明显糊。
对从业者:免训练、即插即用,给现有 DiT 视频管线直接省一大半推理算力,不用重训、不用换权重。视频生成是当前最烧卡的环节之一,这类方法的价值在于把「等几分钟」压成「等一分钟」。它是工程红利,不是能力突破,生成质量的上限没变。