Velocity Scaling in Flow Matching
Youssef Saied, François Fleuret
cs.CV
2026-10-08
在采样时把 Flow Matching 的速度乘上按群体时间滞后标定的常数增益,无需重训,无引导 SiT-XL/2 于 ImageNet-256、NFE 25 的 FID 从 28.0 降到 12.2,扫网格最低到 8.7。
Flow Matching 沿直线把噪声送到数据,采样是对速度场做数值积分。Li 等人(ICML 2026)把预测速度乘上增益 γ(t),无引导 SiT-XL/2 在 NFE 50 下 FID 从 13.7 降到 7.6,并归因为均方误差把速度模长估小了。Scale Schedule Corrector 用 γ(t) = 1.1 − 0.1t。平均增益接近的日程,FID 落在 7.5 到 7.8。步数一少,中间更新被跳过,样本自己的结构来不及出现,状态就落后于求解器标出的时间。
总体最优场是条件均值 v(x, t) = E[U | Xt = x],输运是精确的。均值比单条目标短,短的是交汇轨迹的残差,条件均值为零。高斯路径上增益 1 到达目标协方差 Σ,其他增益给出 Σ^γ。预训练 SiT 在 20 个时刻、16,000 对 ImageNet 图像–噪声上,最贴合目标的标量乘数均值是 0.999。真实路径上没有速度亏空。
这种落后叫群体时间滞后。Figure 1 固定类别、噪声和布朗路径:NFE 25 不缩放时物体更晚成形,常数增益 1.15 把粗轨迹往前赶。两步欧拉在 t = 0.5 缺少每张图自己的结构,归一化探针给出 0.254,真实状态是 0.493。
探针只在真实路径上训练。三层卷积探针输出 20 个时间箱的后验均值,留出误差 SiT 0.0258、ADM 0.0250、CIFAR-10 0.0141。滞后用真实状态与采样状态的平均读数之差,单条噪声很大,SiT 相对群体曲线的平均绝对偏差是 0.0226。沿路径退回 0.05,估计下降 0.0499;垂直挪同样远,只降 0.00519。
模型时间校正不乘速度,输入时间改为 t 减滞后。速度缩放不改时间,把速度乘上 γ。步长 h 要对上落后量 τ − t,一阶条件是 γ(τ − t) ≈ h。
γlag 最小化轨迹上的滞后均方,分辨率 0.01,每候选 256 条轨迹,不看图像。XL/2 在 NFE 50 用 6 个候选、76,800 次前向完成标定;一个 50,000 张的 FID 点要 250 万次前向,中位 4.7 个 RTX 4090 小时。平均增益同为 1.07216 时,日程的 FID 是 13.0,常数是 12.5。
无引导 ImageNet-256,每点 50,000 张配对图,采样器是均匀随机欧拉。滞后增益的 FID 由相邻实测点线性插值,摘要写作 12.21,表中记为 12.2,没有不确定区间。Li 等人的 13.7 来自另一套混合 SDE,不和这张表的 28.0 直接比。
| 模型 | NFE | 不缩放 | 滞后增益 | 网格最低 |
| SiT-S/2 | 25 | 71.1 | 50.9 | 44.4(γ=1.15) |
| SiT-B/2 | 25 | 47.9 | 30.2 | 25.9(γ=1.125) |
| SiT-L/2 | 25 | 30.2 | 16.1 | 13.4(γ=1.125) |
| SiT-XL/2 | 25 | 28.0 | 12.2 | 8.7(γ=1.15) |
| ADM U-Net | 25 | 34.8 | 17.9 | 14.7(γ=1.125) |
| SiT-XL/2 | 250 | 9.7 | 9.1 | 6.3(γ=1.05) |
| ADM U-Net | 250 | 16.8 | 15.8 | 12.8(γ=1.05) |
二十个 ImageNet 设置里,滞后增益平均收回 49% 的 FID 降幅,NFE 25、50、100、250 依次是 81%、63%、38%、15%。CIFAR-10 上 NCSN++ 的最低点在增益 1,NFE 50 的滞后增益插值到 4.1,高于不缩放的 3.0。
只改时间、不乘速度,公开混合 SDE 在 NFE 50 从 13.8 降到 8.8,去掉全局模长后是 8.6。ADM U-Net 从 22.7 降到 16.7,增益 1.075 到 13.2。
冻结场回放旧速度再乘增益,五个 SiT 检查点在随机采样下只拿到完整降幅的 22.4% 到 24.9%,确定性采样下 SiT 为 53.9%、ADM 为 59.0%。换成径向推力并重新求值,FID 变差。
网格最低增益在二十个设置里都高于 γlag。用 NFE 25 的比值当 κ,四个 SiT 在更高 NFE 上的平均绝对误差是 0.011。XL/2、NFE 250 的 κ 点为 6.6,网格最低 6.3。同样 50 次求值,Heun 的滞后 RMS 为 0.005,欧拉是 0.019,最低增益从 1.10 降到 1.05。CFG 加强后最低增益会低于 1。FID 选中的增益高于 sFID,precision 上升、recall 下降。缩放还把更多终点方差分给真实数据里更散的方向,据此选出的增益,估计 FID 与最低值相差在 0.2 以内。
增益乘在采样时的速度上,权重不用重训。NFE 25 的 XL/2,FID 从 28.0 到滞后增益的 12.2,增益 1.15 扫到 8.7。标定大约 7 万次前向;50,000 张的一条 FID 曲线中位要 4.7 个 GPU 小时。滞后增益在 NFE 25 收回大约八成降幅,到 NFE 250 只剩大约 15%,再往下要乘 κ 或直接扫指标。
步数加多、换成 Heun、或加大 CFG,合适增益都往 1 移动,强引导下会小于 1。CIFAR-10 像素模型停在增益 1。把它当成固定的 1.1 倍速度,细采样和强引导都会用反。
它修的是状态和时间对不齐。MixFlow 训练时改喂更早的状态,Time-Shift Sampler 改下一步的时间,Epsilon Scaling 缩小扩散模型的噪声预测。速度缩放沿已学速度把状态送前,再在新状态上重新预测。模长亏空对不上精确的总体解,也对不上 0.999。
滞后留有一块 FID 降幅解释不了。二十个无引导设置里网格最低增益一律更高,NFE 到 250 仍是这样。κ 只是 NFE 25 上的一个比例,平均绝对误差 0.011 表示它大致能外推,不能当成两个分开的机制,也没有更细步长下的极限值。
12.2 是插出来的。增益 1.07216 的两批独立 50,000 张图,FID 为 12.5 和 12.7,批间约 0.2。和 8.7 相差很远,和相邻网格点的零点几则没有区间。探针改不了单张图。三个种子在 XL/2、NFE 50、分辨率 0.01 都给出 1.04,但区间不含重训探针的不确定性。
配齐终点矩代替不了积分中的缩放。NFE 50 上匹配半径,FID 仍是 13.8;NFE 100 上配齐潜变量均值和协方差,FID 从 11.6 升到 12.3。NFE 250 的 ODE 上,不缩放终点均方误差是 0.004,SSC 是 0.052;单步误差也比不缩放高。重新求值的重要性随采样器变:随机采样里冻结场只解释约四分之一,确定性采样里约一半。离散误差在粗步长上确实存在,盖不住全部收益。
CIFAR-10 上大于 1 的增益没有好处。REPA 检查点做过,主表没有单独列出。代码尚未发布。强引导里速度模长的上升,盖不住最优增益降到 1 以下。幅度感知损失放大的是条件均值,残差留在原地,图像指标没有测。