TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement
Karim Aly, Alexei Sharpanskykh, Jacco Hoekstra
cs.LG, cs.AI
2026-08-12
用 IQR 挑出极端记录单独训练生成模型,再用自编码器清洗操作上不合理的样本,六个回归模型在极端航班事件预测上的 MAE 降低 29%~57%。
航班大面积延误、空中时间异常这类极端事件,在历史数据里只占几个百分点,机器学习模型因此学不到尾巴上的模式,预测严重延误时系统性失准。合成数据增强是标准解法,但有两个坑:常规生成模型天然欠表征分布尾部,采样再多尾巴也长不出来;生成的记录可能操作上不可行,比如短空中时间配上长航距,这种样本喂给模型只会引入噪声。此前没有方法同时解决这两个问题,而领域内已有的合法性约束方案(如 zGAN)要手工写物理规则,换个领域就得重写。
框架叫 TailBooster,双层结构,核心是把「补尾部信号」和「剔除非法样本」拆成两道独立的门:
整个清洗过程完全数据驱动,不写任何航空领域的符号规则,因此换到金融、能源等极端事件同样重要但没有现成规则的领域,不需要重新工程化。生成器也不绑定 TVAE,可以换成条件 GAN 等任意模型。
数据是美国 2023 年 1 月纽约州国内航班 60,767 条,训练和测试都在极端子集上进行。六种回归模型(RF/XGBoost/CatBoost/LightGBM/SVR/k-NN)全绿:
| 训练数据 | 极端空中时间 MAE | 极端到达延误 MAE |
| 常规合成 | 19.4023.58 分钟 | 34.4147.58 分钟 |
| 增强合成(TailBooster) | 10.2112.23 分钟 | 14.8934.00 分钟 |
| 真实数据 | 6.349.88 分钟 | 11.5432.93 分钟 |
| 真实+合成极端 | 2.578.59 分钟 | 4.4924.77 分钟 |
极端空中时间预测 MAE 降 4749%,极端到达延误降 2957%。更实用的一条:即便手里有真实数据,把合成极端样本混进去再训,MAE 也能从 11.5432.93 分钟降到 4.4924.77 分钟,Random Forest 在延误任务上直接从 12.09 降到 4.49。保真度侧,分类器区分真实与增强合成数据的判别力在极端子集上从 0.92/0.88 降到 0.54/0.58,说明合成的极端样本确实贴近真实尾部。
对做表格数据增强的从业者,这是少数把尾部表征和操作合法性一起处理的方案,而且两个组件都轻量:IQR 切分是几行代码,清洗层就是标准自编码器。对手里有真实数据的团队(航司、机场、金融机构),结论更直接:混合合成极端样本是无成本涨点的路径,六个模型全部有效说明这不是某个模型家族的特性。代码承诺在论文发表后开源。
论文自己列了三条:只在单个数据集(2023 年 1 月纽约州航班)上验证,跨季节、跨区域的泛化未知;操作合法性只用散点图目测评估,没有量化指标,进不了超参优化目标;极端子集本身只有三四千条,训深度生成模型的多样性受限。读下来还有一点:MAE 的对照基准是常规合成数据,也就是「一个已知欠表征尾部的基线」,4749% 的相对降幅要放在这个语境里看,论文没有和 SMOTE 等传统过采样方法对比。