块三角联合漂移一次评估走一步,湍流能量误差降到ReFlow的四分之一

One-Step Generative Surrogate Models via Block-Triangular Joint Drifting

Nicholas Geissler, Shreya Jha, Ricardo Baptista, Benjamin Peherstorfer

cs.LG, math.NA

2026-09-22

对相邻状态联合分布做块三角投影漂移,一次网络评估采样下一步。二维湍流能量误差2.14e-2,约为单步ReFlow蒸馏的四分之一。

这篇在解决什么

随机系统的廉价代理要能从当前状态采样下一步的条件分布,再自回归滚出整条轨迹。扩散和流模型能拟合这种转移律,但每一步物理时间往往要 K 次去噪或积分,T 步 rollout 就是 KT 次网络评估,集合预报会很贵。

蒸馏路线(MeanFlow、ReFlow、consistency)能把 K 压到 1,通常要先训一个多步老师再压缩,精度换速度。只拟合时间边缘的方法(DICE、边际扩散)更快,但边缘定不了轨迹级统计。确定性步进器从同一初值永远走出同一条路径,表示不了固有随机性。

Drifting 本来就是为单步生成设计的:训练时用分布相关的漂移场把模型样本推向目标,收敛后噪声到样本只需一次前向。麻烦在于漂移场要靠目标分布的经验样本来构造。轨迹数据对每个观测到的当前状态只有一个实现的下一步,条件分布的经验近似就是点质量,没有宽度、形状、多峰。扩散和流匹配的回归目标不需要同一条件状态的多次实现,漂移需要。

方法

BTJD 换了漂移目标。不去漂条件转移律,去漂相邻状态的联合分布。轨迹对本身就是联合分布的样本,只要轨迹条数大于 1,每个时刻都有一堆对可以用。

生成器钉成块三角形式:输出第一块恒等于当前状态、与参考噪声无关,所以当前状态边缘永远保持为真实边缘;第二块才是可学习的条件映射 g。联合分布一旦匹配上,g 就把噪声推到条件转移律上。这个结构来自块三角传输的既有结果。推理时给定当前状态抽一个噪声,一次网络评估得到下一步。

漂移场对联合分布的 Sinkhorn 散度求一阶变分,再正交投影到第二块:只移动下一步分量,当前状态钉死。损失因此退化成只对 g 的平方回归。时间上参数共享,每个 batch 抽若干时刻和若干转移对,用经验 Sinkhorn 重心投影估场。

理论给了一个无正则(熵系数 ε=0)的理想化定理:紧支撑、密度上下有界、两边第一边缘相同,投影后的漂移场为零当且仅当模型联合分布等于目标。实际训练全是 ε>0 的 Sinkhorn。Duffing 上 ε=0.01、每步 50 次迭代;PDE 上 ε 约 0.07 到 0.1、20 次迭代。高维场先压进自编码器潜空间再漂。

结果

四组实验。低维用 sliced Wasserstein-2 看边缘,再用路径相关的兴趣量看是不是真学到了转移律。

Duffing 振子(噪声强度 0.5,1200 步,5000 条训练轨迹),随机初值:

方法sliced-W2轨迹 QoI 误差
确定性步进器3.48e-13.68e-2
DICE5.80e-18.30e-2
边际扩散8.10e-21.07e-1
SDE learning8.30e-25.70e-3
SDE matching5.49e-14.47e-2
BTJD4.80e-22.75e-3

固定同一初值时,BTJD 的 W2 是 5.80e-2、QoI 2.49e-3,仍低于 SDE learning 的 1.08e-1 和 6.80e-3。同一点出发能散开一簇轨迹,随机性来自转移律,不是初值抖动。

9 维 Rayleigh–Bénard,训练控制参数取 13.5 到 14.2 的离散点,测试未见参数 13.65:BTJD 的 W2 为 4.60e-2,旋转电流 QoI 为 3.00e-4。次优 SDE learning 是 5.40e-2 和 2.20e-2。边缘对了不算完,旋转方向这种轨迹量也对上了。

高维才跟多步生成模型比。随机 Burgers,64 格点压到 16 维潜空间:

方法能量误差涡量平方误差每步 NFE
Operator learning2.21e-22.55e-11
ARDM 100 步1.24e-22.11e-1100
CFM 20 步2.71e-31.53e-120
MeanFlow 1 步8.22e-13.59e+21
ReFlow+蒸馏 1 步2.78e-31.40e-11
BTJD2.22e-35.87e-21

涡量平方误差不到次优方法的一半。MeanFlow 单步在这组上崩掉了。

二维随机强迫湍流,训练分辨率 64×64:

方法能量误差涡量平方误差每步 NFE
ARDM 100 步1.16e-11.34e-1100
CFM 20 步1.39e-11.04e-120
MeanFlow 4 步1.22e-16.74e-24
ReFlow+蒸馏 1 步8.60e-27.16e-21
BTJD2.14e-22.52e-21

能量误差大约是次优 ReFlow 的四分之一,涡量平方大约三分之一。同一初值多次 rollout 会分叉成不同湍流实现;确定性算子学习从同一初值永远走出同一条。

为什么重要

集合预报、不确定性量化和外循环设计需要又准又便宜的随机轨迹。BTJD 把单步采样做成训练目标本身,不经过老师蒸馏。实验室和仿真日志里的轨迹,本来就是「每个状态只有一个后继」,这个设定对得上。

适合已经有一批随机轨迹、要快速再采样路径级统计(能量、涡量、过势垒次数)的场景,而不是只画某一时刻的直方图。训练阶段每步要跑 Sinkhorn,推理才是真便宜。

Burgers 上 MeanFlow 单步崩掉,说明「先训 CFM 再蒸馏到 1-NFE」不是免费午餐。这仍是科学计算向的生成式降阶模型,不是通用图像生成器。

局限与存疑

固定点结论只覆盖 ε=0、紧支撑、密度有界的理想情况。实验全是 ε>0 的 Sinkhorn。投影会不会引入额外零点,论文只在这个理想设定里排除。

训练开销几乎没报。每步 20 到 50 次 Sinkhorn,batch 大到 8192 粒子,低维 10 万步、湍流 6.5 万步。1-NFE 是推理账,不是训练账。

Burgers 和湍流都先压进自编码器,表格误差是解码后的场量,潜空间重构误差没有单独拆开。低维实验没放 CFM、ARDM 和蒸馏,高维才放,跨设定的全面最优要打折。MeanFlow 在 Burgers 上的灾难性失败,对比强度取决于蒸馏实现有没有调到位。

条件输入还人为加了 1% 到 2% 的高斯噪声。长程误差累积、超出训练时间窗的外推,没有专门压力测试。

术语

原文与代码

社区讨论

相关论文

全部论文解读