免训练给扩散模型提速 4.8 倍:用切比雪夫多项式预测中间特征

Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration

Jiaqi Han, Juntong Shi, Puheng Li, Haotian Ye, Qiushan Guo, Stefano Ermon

CVPR 2026

cs.CV, cs.LG

2026-03-02

无需重训,只在采样时缓存 Transformer 最后一层特征、用切比雪夫多项式外推,FLUX.1 提速 4.79 倍且 PSNR 反超 TaylorSeer 近 5 分。

这篇在解决什么

扩散模型(Diffusion)生成一张图、一段视频要跑几十步去噪,每步都是一次完整的网络前传,慢。一类叫「特征缓存加速」的办法利用了相邻去噪步的特征变化平缓:跳过部分步的网络前传,用前面算过的特征凑出被跳过的部分,等效减少前传次数(NFE)。代表方法 TaylorSeer 用泰勒展开预测被跳过的特征,但它有个毛病,误差随步长放大,步子迈大了画面就糊。核心矛盾是要么少省(小步)、要么糊(大步)。

方法

Spectrum 的观察是:在网络某一层,特征的每个通道随去噪时间 t 的变化曲线其实很平滑,可以用低阶多项式拟合。它不用泰勒(泰勒误差与步长的高次幂挂钩),改用切比雪夫多项式(Chebyshev polynomial)做岭回归拟合,误差上界只取决于多项式阶数,不随步长放大。

具体做法:

这套机制同时适用于 DiT(FLUX、Wan、HunyuanVideo、SD3)和 U-Net 结构的 SDXL,说明它绑的是「特征随时间平滑」这个性质,不绑具体主干。

结果

10 次 NFE 换来约 4.5 到 4.8 倍提速,14 NFE 约 3.5 倍。

模型提速质量(PSNR/dB)对照 TaylorSeer
FLUX.14.79×22.2117.41
Wan2.1-14B4.67×21.2417.24
HunyuanVideo4.56×25.39
SD3.5-Large4.32×

相比「真值」特征的 RMSE,Spectrum 比 TaylorSeer 低 2 到 3 倍。Wan2.1-14B 在 VBench 上仍拿到 82.21。关键在于它在大步长下不崩,TaylorSeer 在同样提速比下明显糊。

为什么重要

对从业者:免训练、即插即用,给现有 DiT 视频管线直接省一大半推理算力,不用重训、不用换权重。视频生成是当前最烧卡的环节之一,这类方法的价值在于把「等几分钟」压成「等一分钟」。它是工程红利,不是能力突破,生成质量的上限没变。

局限与存疑

术语

原文与代码

社区讨论

相关论文

全部论文解读