像素 Flow Matching 换成 f-loss,早期补高频、收敛最多加快 40%

Balancing Frequencies and Pixels in Flow Matching

Lucas Degeorge, Paul Couairon, Arijit Ghosh, Alexei A. Efros, David Picard, Vicky Kalogeiton

cs.CV

2026-09-02

给像素空间 Flow Matching 加频谱损失 f-loss,早期拉齐各频段学习,后期切回像素 v-loss。ImageNet 上收敛最多加快 40%,加感知损失后 50 万步 FID 1.83。

这篇在解决什么

自然图像的功率谱大约按 1/f² 衰减:能量堆在低频的大结构上,边缘和纹理这些高频只占稀疏的一小截。像素空间的重建损失对每个像素一视同仁,低频残差幅度大,梯度就被它占满,细纹理学得晚。

这在像素空间的 Flow Matching 里特别明显。JiT 已经把预测目标从速度场改成干净图像(x-prediction),否则高维像素上直接回归速度会崩。但改完目标,损失仍是像素 MSE。把 v-loss 模型生成图的径向功率谱拿来跟真实 ImageNet 比:低于 10⁻¹ cycles/pixel 的低中频高出约 20%,高于 8×10⁻¹ 的高频缺口一路拉到 Nyquist 附近将近 -60%。一个只有两个频率成分的玩具 MLP 更干脆,低频很快学会,高频全程学不进去。早期容量耗在低频上,后面补不回来。

方法

新损失叫 Focal Log-Frequency Loss,简称 f-loss。对预测图和目标图做 2D FFT,每个频率的残差走三步:

f-loss 看的是频谱幅度,对相位不敏感,锁不住边落在哪个像素上。所以后期还得切回像素 v-loss。联合目标是 wf·Lf + wv·Lv,权重走一条从 1 降到 0 的 sigmoid:前期几乎纯频谱,过了两条曲线的交叉点之后交给像素。反向调度(先像素后频谱)是消融里最差的几档之一。网络结构不动,当 drop-in 损失用。

结果

主实验是 ImageNet 类别条件生成,JiT 骨干,256 和 512。50k 张图、Heun 采样 50 步。

设置步数FID ↓IS ↑
JiT-XL/16750k2.21297.4
fv-loss XL/16750k2.13290.3
DeCo(+REPA)1.6M1.90303.0
fv-loss +REPA750k1.87301.0
PixelGen(+REPA+感知)800k1.83293.6
fv-loss +REPA+感知500k1.83323.4

同结构同预算,FID 从 2.21 降到 2.13,IS 略降。加上 REPA,750k 步摸到 DeCo 训 1.6M 步的位置。再加感知损失,500k 步 FID 追平 PixelGen 的 800k 步,IS 从 293.6 拉到 323.4。

分模型看,早期差距更大。JiT-L/16、256、80 epoch、无 CFG:v-loss 的 FID 是 26.90,fv-loss 是 19.47;有 CFG 时 5.40 对 3.93。训到 320 epoch,guided FID 变成 2.63 对 2.55,末期收窄,对上「频谱管前期、像素管收尾」的设定。512 上 JiT-B/32 训 320 epoch,unguided FID 从 31.94 降到 29.12。

换 PixelDiT 也成立。200k 步 FID 15.09→10.18,600k 步 10.25→5.92,大约一半步数到同样水平。FFT 有开销:JiT-B 训 400k 步,纯 f-loss 墙钟 +4%,fv-loss +14%。100 分钟时因为步数少还落后,200 分钟之后反超。

把 Jiang 等人 2021 年的原始 Focal Frequency Loss 直接套进来,guided FID 是 19.24,f-loss 是 6.39。对数压缩和按最大残差归一化都去掉不得。

为什么重要

像素空间生成这几年又热起来,很多工作在改结构:多尺度、频率分支、解耦。这篇把问题收成一条损失,现有像素 flow 代码改损失函数就能试。训练预算紧的时候,前期加速最值钱。和 REPA、感知损失可叠加。

这是目标函数上的渐进改进,不是新架构。潜空间里收益弱一截:SiT-B 改成 x-prediction 后,epoch 80 的 FID 从 v-loss 的 41.35 降到 f-loss 的 36.38,仍高过原版 v-prediction 的 33。VAE 已经把很多高频扔掉了,这篇诊断的主战场在像素。

局限与存疑

作者自己说,频谱偏置的来源还没讲清楚:为什么纯 f-loss 后期会平台,为什么切回像素更好,只给了「相位和空间对齐」这个假说,没有单独实验把相位误差拆开。摘要写加速最多 40%,XL 的 teaser 曲线标的是 1.25×,不同尺度和是否 CFG 差很多,不能当成统一加速比。

实验几乎全是 ImageNet 类别条件,没有文本到图像。潜空间只试了 SiT-B 一个点。fv-loss 同时反传两路,+14% 墙钟在大模型上会不会被 FFT 和双损失放大,论文只用 JiT-B 测过。

术语

原文与代码

社区讨论

相关论文

全部论文解读