数据空间迭代免调时间表,ImageNet四步FID 2.46

Few-Step Generation via Data-Space Iteration

Shanchuan Lin, Yansong Peng, Fu-Yun Wang, Haoqi Fan

cs.LG, cs.CV

2026-10-08

同一套 DMD 训练下,数据空间迭代四步生成的 ImageNet FID 为 2.46,好于均匀时间网格的 2.75。

这篇在解决什么

Flow matching 学一条从噪声到数据的连续速度场,采样要沿概率流做数值积分,常常几十到上百次前向。蒸馏能压到一步,但单次前向的计算深度不够,画质掉得看得见。少步才是实际工作点,高分辨率系统里四步很常见。

现有少步生成仍在概率流上迭代。Flow-renoise 每步先预测干净图,再按下一个时间点掺回噪声。Flow-map 直接学相邻时间点之间的映射,phased DMD 属于这一类。两边都要一条事先写死的时间网格。Self-rollout 里,下一步的输入来自模型自己的上一步,网格必须在开训前定好,换一条通常就要重训一个生成器。网格还是全局的。类别不同、区域的频谱不同,细化难度不一样,步长却被绑在同一条表上。

方法

数据空间迭代不沿时间轴走。噪声 z 固定,预测从 0 起步,共享网络反复输出 z 减去一个速度网络。输入是上一次的数据预测、同一份 z 和步号 r,流时间恒为 1。中间不掺噪声,也不做中间流状态。每一步都要直接给出当前容量下最好的样本。条件 r 让修正随阶段变化;去掉它,四步 FID 从 2.46 升到 2.63。

训练只换 DMD 的 rollout。冻结教师和带 r 条件的 fake 速度场做差,推动学生分布;前 r 步停梯度,只反传当前步。算力和显存与对照 DMD 相同。GAN 与 rectified flow 辅助损失不加入,免得把迭代空间这个变量淹没。已有的 self-conditioning 仍去积分一条 ODE,上一步预测只用来修正速度;这里被迭代的状态就是数据预测本身。

生成器以预训练速度网络初始化。当前预测多一条投影,与噪声投影相加;r 嵌入进时间通路;流时间固定为 1。输出定义为 z 减预测速度,与线性路径在噪声端的公式一致。去掉时间 MLP、改用常数嵌入后,参数从 675,129,632 降到 673,527,200。

形态接近不动点迭代,但 r 让每步映射可以变,损失打在每一步而不只打在收敛后,也不要求真的收敛。最优传输正则 λ 取 1e-6 时,四步 FID 从 2.46 变为 2.47,没有留下。

结果

实验在类条件 ImageNet 256 的潜空间进行,教师是 SiT-XL/2。FID 对 5 万张类别均衡样本和训练集计算,越低越好。所有方法 R 为 4,学习率 1e-4,批大小 256,训练 40 个 epoch,每 1 次生成器更新配 4 次 fake 更新。Adam 的 β1 取 0、β2 取 0.95 时,四步 FID 为 2.46;β1 取 0.9 时为 2.66。DMD 时间按 Beta(2.5, 1) 抽样且权重为 1;均匀抽样、权重同为 1 时,四步 FID 为 3.61。靠近 0 会发散的两种经典分数权重,训练直接崩溃。

无引导的四步 FID 见下表。

方法时间网格FID
SiT 教师,250 次前向连续积分8.26
DMD flow-renoise均匀2.75
DMD flow-renoise三档中最好2.72
Phased DMD均匀2.55
Phased DMD三档中最好2.48
数据空间迭代无2.46

数据空间 1 至 4 步为 3.85、2.68、2.47、2.46,第 3 步之后基本走平。Flow-renoise 第 3 步 2.67,第 4 步退回 2.75。均匀网格上每个步数都是数据空间更低。Flow-map 的中间状态不是合法样本,表里只有 4 步。

引导尺度 1.1,且只加在 τ∈[0, 0.6] 时最好:数据空间四步 2.29,flow-renoise 2.61,均匀 phased DMD 2.86,三档最好的 phased DMD 2.37。尺度 1.1 若铺满全部 τ,四步 FID 从 2.46 升到 2.59;尺度 1.2 升到 3.27。教师开引导需 250×2 次前向,FID 2.06。γ 取 0.5、1、2 时,最优一档随方法和引导开关对换。

无引导四步并不全面领先。数据空间 sFID 4.48、recall 0.59,好于 flow-renoise 的 4.62 与 0.55,也好于 phased DMD 的 5.05 与 0.56。Inception Score 相反,245.76 对 228.59;精度 0.83 至 0.84,对数据空间的 0.81。解码后 RGB 上,第一步 L2 为 82.72 对 59.65;第三步间隔数据空间仍有 35.98,flow-renoise 为 29.91。重掺噪声会抹掉已经成型的区域。

CIFAR-10 用 55M 的 SongUNet,未再调参。教师 250 步 FID 3.54。四步 FID:数据空间 8.62,flow-renoise 10.03,phased DMD 11.72。一步时两者几乎同一式子,数据空间 12.20,略差于 11.21。数据空间与 flow-map 各训三次,标准差低于 0.05。

为什么重要

DMD 蒸馏里要改的只有 rollout。同一份噪声反复改写数据预测,不必按时间网格重训学生。无引导时,均匀网格的对照是 2.75 和 2.55,数据空间是 2.46;三档手选最优是 2.48,优势只剩 0.02。有引导时,未搜索的 phased DMD 为 2.86,搜过的为 2.37,数据空间为 2.29。

幅度是渐进的。省下的是训练侧搜索,每试一档就要多训一个学生。GAN 和整流项被故意拿掉,2.46 不是公开榜数字。必须自回放的系统,例如因果流式视频,更用得上;网格只在推理时选,动机弱。

局限与存疑

自回放是前提。蒸馏本来就 rollout 时没有额外成本。改成 ODE 逐点回归,配对样本能训,更省的做法仍空着。主实验是 ImageNet 256,文生图留到以后。论文写明,四步之后 FID 不再降。

无引导下「胜过搜索时间表」不稳,2.46 与 2.48 相差 0.02,重训标准差低于 0.05。有引导的 2.29 对 2.37 才离开这个带。搜索只含三个 γ。DMD 时间若只从当前阶段抽到 1,一步 FID 约 44,四步仍约 2.5,损失侧的时间分布依然敏感。

样本和位置需要不同步长,引言提了,实验没测。r 是全局步号。网格去掉了,还没有位置自适应的证据。无引导时学生远好于 250 步教师,论文猜测来自反向 KL 的逐模式倾向。Recall 从 0.67 降到 0.59。开引导后四步 2.29,仍差于教师 2.06。

术语

原文与代码

社区讨论

相关论文

全部论文解读