Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors
Alexander Scheinker
stat.ML, cs.LG, physics.comp-ph, physics.plasm-ph
2026-08-01
训一个带方向标志的双向扩散模型,前滚 i 步再倒回的往返误差即零真值误差代理;MHD 上 OOD 检测 AUROC 0.98,双向训练还比单向专家更准更省。
用学习型代理模型(neural surrogate)替代数值求解器,已经是科学计算和天气预测的常态,扩散模型也开始当概率模拟器用。但它们都是自回归地往前滚:把上一步的预测当下一步的输入,单步小误差逐步累积,输入分布漂离训练数据,精度在某个不可预测的深度垮掉。麻烦在于部署期(等离子体控制、加速器诊断、天气预报)真实状态未知,模型没法说清自己还能信到几时。
现有的不确定性量化(深度集成、MC dropout、学到的方差、共形区间、重复采样的离散度)量的都是「模型自己跟自己分歧多大」(dispersion),不是「学到的动力学有没有被准确套到这条轨迹上」。而自回归滚动引发的分布漂移,恰好会让这类离散度信号失效。
作者训一个带方向标志 cd ∈ {+1, -1} 的条件潜在扩散模型,同一套权重既表示系统向前演化(代理求解器),又表示时间反演(逆求解器)。去噪器以最近两帧为条件。结构上用 β-VAE 把物理场压到潜在空间(MHD 是 512×512 → 16×16×4,256 倍压缩),再用扩散 transformer(DiT)做去噪,DDIM 确定性采样,标量条件(扩散步、时间索引、方向标志)经 adaLN-Zero 注入。
核心机制很朴素:可逆性被变成一个可检验的不变量。一个准确的模型和自己反演的复合应是恒等映射,所以「向前滚 i 步再倒回 i 步」剩下的偏差 Ci,就是真误差 Ei 的自监督代理。Ci 在测试期全部可得(锚点对是编码过的实测数据,返回对完全由模型生成),代价只是一次额外滚动,即 2 倍推理开销,不用真值、不用集成、不用控制方程。
理论(命题 1)给出 Ci 与真误差 Ei 的夹心界:在反向映射双利普希茨(既有压缩上界 L 又有扩张下界 μ)的假设下,Ci 被夹在 Ei 的两个仿射函数之间。那个下界 μ 正是「反抵消」条件,禁止反向映射把不同的终点状态压成同一个返回种子(那会让正反向误差相消、骗过检查)。所以检查是必要非充分:小的 Ci 只在反向映射良态(μ 不太小)且在干净数据上准确(残差 δ 小)时才能保证小误差,这两个量都能离线估出来。
在五个系统上验证:可压缩磁流体力学(MHD,512×512)、以 Orszag-Tang 涡作 OOD 压测、天体物理湍流辐射混合层(the Well 基准)、人脸视频(CelebV-HQ)、湍流 Navier-Stokes(LE-PDE-UQ 基准)。
| 指标 | 结果 |
| Ci 与真误差的 Spearman 相关(定深度,跨轨迹) | 0.91-0.98(i=20 时 0.97) |
| 轨迹内 Spearman | 0.69 ± 0.16 |
| 校准器预测误差倍数 | 1.14×(68%)、1.29×(95%),近名义覆盖 |
| 相比仅用深度预测的对数似然增益 | +1.0 nat,对全部 6 个解码物理场为正 |
| OOD 检测(Orszag-Tang 涡)AUROC | 0.98(深度 10 内 1.0) |
| 选择性预测(80% 覆盖)降低误差 | 15%(仅用深度早停只降 5%,即三倍之差) |
几个关键点:
一个重要细节:逐轨迹信号的价值,正比于轨迹间难度差异相对于度量噪声有多大。MHD 上大(±28% 因子),辐射层上边缘(±11%,仅用深度已接近最优),自然视频上最大(逐片段难度差异主导)。
对做科学机器学习、PDE 代理、物理仿真、天气与气候预测的人,这是部署期能用上的东西:一个不依赖真值、随模型走的「误差表」,告诉你这条自回归预测还能信多远。它补的恰好是离散度信号补不了的窟窿。模型系统性犯错时(给定上下文就一路错下去),自我分歧看不出问题,而往返漂移能。
更宽地看,把可逆性当信任信号是个可迁移的思路:任何能学出时间反演的生成模型(包括可能的语言模型时间反演)都能用往返一致性自检,前提是反向映射良态。