架构平平的 585M 时序模型拿下 GIFT-Eval 点预测第一,赢在采样策略

Into the ORBIT for Time Series: Training Regimes for Foundation Models

Hongjie Xia, Yiding Liu, Yifan Hu, Peiyuan Liu, Zewei Dong

cs.LG, cs.AI

2026-08-13

蚂蚁团队的时序基础模型 Falcon-2.0 用刻意简单的 585M encoder-only Transformer,靠 ORBIT 采样范式精确控制预训练分布,拿下 GIFT-Eval 29 个预训练模型的点预测第一。

这篇在解决什么

时序基础模型(TSFM)这两年的进步几乎全押在架构上:分组注意力、flow matching、串行 token 预测、MoE 扩容。但决定模型实际学到什么的,是训练时数据怎么暴露给你:哪些数据集出现多少次、用多长的上下文、预测多远的未来、缺测怎么处理。这一层基本没人系统做过。

具体四个耦合的失控点:大容量数据集主导优化轨迹,小领域欠曝光;不同采样频率需要不同长度的历史,固定上下文不够;预测 horizon 各任务差异大,现有模型常按 horizon 分阶段训;真实时序缺测无处不在,归一化、token 化、注意力、损失每一环都要一致处理。MOMENT 顺序遍历加滑窗枚举,谁的窗口多谁曝光多;Moirai 的长度感知加权还是偏向总长度大的数据集。有效训练分布被语料布局决定,而不是被设计决定。

Falcon-2.0(蚂蚁国际团队,技术报告,模型已开源)把这一层当成主战场,架构反而刻意从简。

方法

ORBIT(Omni-Range Bootstrap Incremental Training)分两半。

Bootstrap 多级采样负责构造分布。语料层面,给每个数据集 prescribed 权重,一条低差异贪心混合规则把权重翻译成全局训练流:每个槽位选「当前累计配额亏欠最大」的数据集。独立分类采样只在期望上配平,这条规则让累计组成每个时刻都贴着目标。数据集内部,四级随机采样生成样本索引五元组(记录, 目标变量, 上下文起点, 上下文终点, 预测长度):记录等概率抽,变量等概率抽,分割点在可行区间均匀抽,上下文起点和 horizon 再条件均匀抽。一次性离线建好缓存,可复现、可随机访问。对照滑窗枚举,相邻窗口大量重叠,曝光由窗口数决定;这里每个维度都随机化,曝光由设计决定。

Omni-Range 增量训练负责消费分布。上下文左填充、目标右填充到批内最大值,注意力和损失 mask 排除无效位,长短上下文与长短 horizon 在同一批次共存,整个训练单阶段完成。没有 Chronos-2 的分阶段能力细化,没有 Timer-S1 的长上下文扩展阶段。样本按需从内存映射存储加载,只取需要的片段。

主干是 Chronos-2 的单变量 encoder 换简版:缺测感知的三通道 patch token(时间、值、观测指示),arcsinh 可逆实例归一化,双向 encoder 加 REG token,未来 query patch 并行入序列,分位数头一次输出全部未来 patch 的 21 个分位数。不用分组注意力,变量彼此独立。32 层、d=1024、585M 参数,B200 集群上 Megatron-LM 训 100 万步。

第二个贡献是 Rank-Guided 跨深度对齐:浅层(第 1 层)向深层(第 31 层)的 stop-gradient 表征看齐,token 级余弦目标。理论部分证明对齐误差小到一定程度时,浅层表征的数值秩不会丢掉深层仍显著的非零谱模。只在训练时用,推理零开销。

结果

GIFT-Eval(97 个数据集-频率-horizon 组合)上,29 个预训练模型里 Falcon-2.0 拿最低归一化 MASE 0.6684 和最佳平均排名 7.81,超过 STRIDE+Timer-S1 的 0.6744;概率侧 CRPS 0.4843 排第七,输给 STRIDE+Chronos-2 的 0.4544。

fev-bench(100 任务)上 MASE 0.6459,距 TimesFM-2.5 的 0.6438 差 0.3%,与 Chronos-2 打平,但 WQL 0.4842 是全场最佳,且没有任何基线在 MASE 和 WQL 上同时压过它。

消融是这篇最有说服力的部分:

消融项GIFT-Eval MASE 变化结论
滑窗枚举 → Bootstrap 随机采样降 11.7%采样规则本身贡献最大
固定 horizon → 联合采样降 6.1%horizon 采样作用大于上下文采样
固定上下文 → 联合采样降 2.9%有用但次要
去掉并行 patch 预测升 8.0%架构侧最大单一贡献

值得注意:四个滑窗变体里,双固定的反而好于采样任一维度,但仍全面输给 Bootstrap 随机采样。也就是说光「变长度」不够,消除相邻窗口冗余、随机化记录与变量选择才是主要收益来源。

尺寸效应温和:75M 到 585M,GIFT-Eval MASE 只降 2.3%,fev-bench 降 4.2%。100 万步训练里 MASE 持续下降无反转。

为什么重要

这篇给 TSFM 圈的启示很直接:你精心调的架构,可能不如对手认真设计的采样。Falcon-2.0 的主干几乎没有新东西,Chronos-2 配方的减配版,成绩却来自数据暴露控制。对要做时序预训练的团队,ORBIT 是一套可以直接抄的工程方案:离线索引、贪心混合、单阶段混合长度训练,不需要多阶段调度复杂度。

对使用者,一个 585M 的开源模型在两大榜单点预测领先,意味着零样本时序预测的性价比门槛又被抬高了。点预测和概率校准没有一个模型全面领先的前提下,Falcon-2.0 占住的是「两边都不差」的 Pareto 位置。

局限与存疑

概率侧没有拿下:GIFT-Eval CRPS 排第七,多变量任务上输 Toto-2.0-2.5B 明显(0.476 对 0.446),长 horizon 也落后。fev-bench 上 46 个带未来协变量的任务是硬伤,MASE 0.652 输 Chronos-2 的 0.621,因为自回归接口不摄取未来特征,这是结构性缺陷不是调参问题。

技术报告本身也要打折看:消融只在 585M 单尺寸上做采样对比,Rank-Guided 对齐在正文里没给出独立的消融数字,它到底值多少分不清楚。采样消融的滑窗基线是作者自己复现的,与各原始论文的训练管线细节有差异。预训练语料七域但只在附录给统计,「domain-aware 权重」具体怎么定的没说。100 万步 B200 集群的训练成本没有披露,复现门槛不低。

另外 ECON/Fin 域点预测明显落后(Toto-2.0 0.739 对 Falcon-2.0 0.785),金融场景用户要谨慎。

术语

原文与代码

社区讨论

相关论文

全部论文解读