去掉时间项的流匹配仍能正确生成,并修正 Equilibrium Matching 的偏置

Beckmann Transport Models: From Autonomous Flows to One-Step Maps

Lee Cheuk-Kit, Florentin Coeurdoux, Peter Potaptchik, Yilun Du, Michael Samuel Albergo, Eric Vanden-Eijnden

cs.LG

2026-08-03

证明无时间项的流匹配仍能正确传输,统一 Poisson Flow 与 Equilibrium Matching 并修正后者偏置;ImageNet 256 单步生成 FID 17.58。

这篇在解决什么

Flow matching 和 diffusion 是当下图像生成的两大主力。它们学一个速度场(velocity field,告诉每个空间位置上的样本该往哪走),再在推理时数值积分一条 ODE,把噪声一步步搬成图像。这条积分通常要几十到几百次网络前向(NFE,number of function evaluations),慢。

Wang 和 Du 2025 年提出的 Equilibrium Matching 给了一个诱人的简化:让速度场不依赖时间,变成一个固定的「自治流」(autonomous flow),网络结构更简单、动力系统也更干净。问题是 EM 原文没证明这个不随时间变的速度场真能把起点分布 μ₀ 精确搬到目标 μ₁,而且它用的训练损失本身带偏置。这篇就是来补这个洞,并把它扩展成一个完整框架。

方法

核心是一个散度方程。作者证明:只要存在正的权重函数 ν 和漂移场 b 满足

∇·(νb) = μ₀ − μ₁

那么以这个 b 为速度的自治流 Ẋₜ = b(Xₜ) 会把几乎每条轨迹送到目标所在的低维流形 M₁ 上,由此定义的映射 T 把 μ₀ 推成 μ₁。μ₀ 是源(只出不进),μ₁ 是汇(只进不出),b 是连接两者的流线。

关键的额外假设是目标 μ₁ 必须「奇异」,即支撑在一个比全空间低维的流形上。这看似限制,其实几乎总能满足:任何分布都可以用零填充(zero-padding)嵌进更高维空间,落在一个仿射子空间上。离散原子分布(若干个点带权重)是维度 k=0 的特例。

这个框架把两件之前分开的事统一了。权重 ν 是一个真正的设计旋钮:取 ν 为时间平均的插值分布,就回到 flow matching 的标准构造;取 ν≡1,b 就是符号电荷分布 μ₀−μ₁ 的库仑势,正好复现训练免费的 Poisson Flow 生成模型(Xu et al. 2022)。Poisson Flow 和 Equilibrium Matching 是同一原理的两个实例。

至于名字里的「贝克曼」:这个散度方程正是 1952 年 Beckmann 运输问题的通量约束。Beckmann 的最优运输一直缺少动力学解释(Benamou-Brenier 当年给 Monge-Kantorovich 提供过类似对应),BTM 补上了这块。附带一个定量结论:自治流的作用量 ∫|b|²ν 上界住 W₂²(最优运输代价),又被标准 flow matching 的作用量上界住。

框架的另一半是「一步映射」。终点 T 沿着流线不变,所以它满足守恒方程 b·∇T=0(在 M₁ 外),边界条件是 T(x)=x(在 M₁ 上)。作者把这个方程离散成一个回归损失,直接从样本学 T,推理时一次前向出图,不用积 ODE。若 T 还没训练充分,可借半群性质把网络迭代几次(T³ 约等于三次前向)逼近完整映射,用多几次前向换更少的训练。

结果

2D 原子分布实验直接暴露 EM 的偏置。作者故意用不等权重的五个点 p=(0.30,0.30,0.15,0.15,0.10),让权重误差一眼可见:BTM 五个吸引域的面积与目标权重之差的平均绝对误差 MAE=0.005,EM 则是 0.102,大吸引域膨胀、最小的几乎消失,误差大 20 倍。机制清楚:EM 的损失在 t=1 处强行把回归目标压成零,这不满足散度方程,流到达目标时权重就错了。BTM 把回归目标绑死在插值导数 İₜ 上,源汇平衡天然成立。

ImageNet 256×256,用 XL/2 架构、和 EM 完全一样的训练预算:

模型设置FID ↓
SiT-XL/2(flow matching)250 NFE2.06
EqM-XL/2(原版,有偏置)自治流1.90
EqM-XL/2(BTM 修正)自治流1.87

修正把 FID 从 1.90 拉到 1.87,几乎免费,不改架构、不加训练量、不动推理。增益小在意料之中:类别分布接近均匀时,权重分配误差本来就小。

一步生成那张表更说明问题:

模型NFE引导FID ↓
iCT130.10
BTM(本文)117.58
Shortcut Models1CFG10.60
MeanFlow1CFG3.43
SiT(带 CFG)2×250CFG2.06

不带分类器自由引导(CFG)的单步方法里,BTM 的 17.58 把 iCT 的 30.10 砍掉近一半。可一旦对手开 CFG,Shortcut 和 MeanFlow 就反超。作者对此很坦白:把 CFG 接进 BTM 还是开放问题。

为什么重要

对做生成模型的人,这篇的价值有三层。第一,它从理论上证明「速度场不必依赖时间」这条简化路线站得住,补了 Equilibrium Matching 缺的证明,并指出原版损失带偏置。任何在用 EM 或类似自治流方法的人,都该检查自己的损失是不是同一个坑。第二,它把 flow matching、Poisson Flow、Equilibrium Matching 统一进一个散度方程,权重 ν 成了可调旋钮,给后续算法设计留了空间。第三,守恒方程给了一条从样本直接学一步映射的路子,把推理压成一次前向,对延迟敏感的场景有用。

要泼的冷水是:这不是一个刷榜工作。ImageNet 上对 EM 的修正只有 0.03 FID,一步生成的 17.58 离带 CFG 的 SOTA(个位数 FID)还有明显差距。它真正的贡献是理论清理,外加一个可能长出更快生成器的框架,而不是当下就能换上去的模型。

局限与存疑

作者自己点名的:框架要求目标奇异(可零填充绕过,但仍是结构性前提);CFG 还没接进 BTM,所以一步生成的数字不算强;训练算力与推理算力的最优分配(迭代几次)尚未刻画;更大规模的直接映射学习留到未来。

读下来的存疑:1.90 到 1.87 这个差距太小,完全可能落在评估噪声里,「修正有效」的说法略显单薄。真正站住脚的证据是那个 2D 实验 20 倍的权重误差对比,而不是 ImageNet 的 0.03。一步生成的对照也不够干净:BTM 不用 CFG,对手大多用,17.58 对 3.43 的悬殊更像是比「谁能用引导」,而不是比映射本身。等 CFG 接进来,这个框架的真实竞争力才会见分晓。

术语

原文与代码

社区讨论

相关论文

全部论文解读