Energy-Guided Flow Matching
Haoyang Tong, Yu He, Fang Li, Lichen Ma, Jingling Fu, Dong Chen, Zhen Chen, Junshi Huang, Jie Cao
JD.com / Xi'an Jiaotong University / MAIS & NLPR, CASIA
cs.CV
2026-08-06
EG-FM 把流匹配的固定终点改成按频率演化的终点,显式监督粗到细顺序;不改主干、不加推理开销,ImageNet 256 像素级生成 FID 降到 1.45,文生图 DPG 83.9。
像素空间生成模型不做 VAE 压缩,直接在像素上建模型,好处是不丢高频细节,代价是得在高维空间里同时学好全局结构和局部纹理。标准 flow matching 把噪声沿直线插值到一张固定的干净图,粗到细的频率演化完全交给主干网络自己从数据里摸索。潜空间扩散绕开了这个麻烦,做法是 VAE 压缩时把高频分量直接扔掉。
EG-FM 的立场是:粗到细这条顺序不该让网络去猜,应该写进训练目标里直接监督。
核心改动一句话:把流匹配的固定终点 x,换成会按频率演化的终点 yt(x)。
设计上有个干净的工程属性:FFT 只在训练时算,推理时主干照常预测速度,FLOPs 和墙上时间都不变。不需要改主干结构,不需要改数据。
ImageNet 256×256 类别条件生成,三个结构不同的主干上 EG-FM 都降了 FID,而且用的 epoch 更少:
| 主干 | 基线 FID(epoch) | +EG-FM FID(epoch) |
| PixelDiT-XL | 1.61(320) | 1.55(200)/ 1.45(600) |
| HyperDiT-H | 1.56(600) | 1.51(220) |
| DeCo-XL/16 | 1.69(600) | 1.63(440) |
PixelDiT-XL 在同等 200 epoch 下基线只有 FID 2.36,EG-FM 把它拉到 1.55,相当于用不到三分之二的训练量超过了基线训练更久(320 epoch、FID 1.61)的成绩。
512×512 上,从 256 的 checkpoint 出发只做 40 个高分辨率适配 epoch,HyperDiT-H + EG-FM 拿到 FID 1.58。
文生图 512×512:EG-FM-T2I(1.3B 参数)GenEval 0.85、DPG-Bench 83.9。同结构的 PixelDiT-T2I 基线 GenEval 只有 0.78;DPG 是所有对比方法里最高的,GenEval 排第二,仅比 1.1B 的 DeCo-XXL 低 0.01;12B 的 FLUX.1-dev GenEval 是 0.67。
开销:训练每步墙上时间增加 0.41%4.81%,每样本 GFLOPs 增加约 0.01%0.03%,推理开销不变。
像素空间生成模型最近在 ImageNet 上把 FID 压到了和潜空间扩散竞争的区间,但训练成本一直是短板。EG-FM 给出的是一个几乎免费的训练侧改造,跨三个不同主干都有效,还能显著省 epoch。对在做像素空间生成的团队,这是一个可以直接叠在现有 flow matching 训练管线上的改动,不碰推理路径。
它也给出了一个可迁移的直觉:flow matching 的直线插值默认所有频率一视同仁,但生成过程是粗到细的,把这个先验显式化比让网络去学更划算。
作者自己在附录里列了几条。一是还没在视频、文图联合建模、具身决策这类时序延伸的信号上验证;二是没在 Flux、Qwen-Image 这个量级的主干上跑过,scaling 还没被证实。
一个不对称是:在 JiT 的 x-prediction 参数化下,EG-FM 只把 FID 从 2.37 降到 2.33,提升仅 0.04,远不如其他主干。原因是 x-prediction 在求解早期阶段预测本身就噪声大、频谱不准,按图算专属节拍的前提不太成立。