TimePre: Bridging Accuracy, Efficiency, and Stability in Probabilistic Time-Series Forecasting
Lingyu Jiang, Lingyu Xu, Peiran Li, Dengzhe Hou, Qianwen Ge, Dingyi Zhuang, Shuo Xing, Wenjing Chen, Xiangbo Gao, Ting-Hsuan Chen, Xueying Zhan, Xin Zhang, Ziming Zhang, Zhengzhong Tu, Michael Zielewski, Kazunori Yamada, Fangzhou Lin
cs.LG, cs.CV
2025-11-24
TimePre 用 5% 修剪的可逆实例归一化 SIN 稳住线性骨干上的多假设学习。六个 GluonTS 集 Distortion 全第一,Electricity 比 TimeMCL(R.) 低 38.8%,Exchange 上单次前向只要 0.03 秒。
概率时序预测要的是未来整条轨迹的条件分布,不是一个点。TimeGrad、TempFlow、TACTiS-2 这类生成模型靠多步采样把不确定性摊开,准,但慢。TimeMCL 换成 Multiple Choice Learning:一次前向吐出 K 条离散假设,用赢家通吃(winner-takes-all, WTA)训练,只给当前样本上误差最小的那个头回传主梯度。
另一边,长序列点预测已经证明线性层和 MLP 骨干够用,DLinear、TiDE、TimeMixer 经常打过 Transformer。把轻量骨干和 MCL 硬接在一起,训练会塌:16 个头里只剩一两头还在学,其余饿死。隔离实验写得很清楚,这不是线性骨干单独的锅,也不是 WTA 单独的锅。通道尺度差、朴素归一化和硬竞争叠在一起,线性层又没有 LSTM 那种非线性流形去压尺度,一个碰巧贴上大幅度通道的头就会一直赢。
TimePre 就三截:Stabilized Instance Normalization(SIN)、逐通道线性编码器、K 个并行头。
SIN 是 RevIN 的修剪版。对每个样本、每个通道,把回看窗里最大最小各切掉 p=5%,用剩下的值算均值和方差,做可逆标准化,预测完再乘加回去。电力、Wiki 这类数据通道量纲能差几个数量级,一个尖峰就能把普通均值方差带飞;WTA 的 arg min 对相对误差尺度极敏感,尺度没校正时梯度会锁死在少数头上。
编码器是单层线性,把长度 L 的回看窗直接投到长度 H 的预测窗,通道各自为政。解码器每个头两块:一条轨迹,一个 sigmoid 置信分。训练用 ε=0.3 的 relaxed WTA,赢家拿 1-ε 的损失,其余头平分 ε,再加一项 β=0.5 的二分类交叉熵,让置信头去认赢家。推理一次前向出齐 K=16 条轨迹和分数,不做自回归、不采样。六套数据共用这一组超参,Adam 学习率 10^{-3},batch 200,最多 200 epoch,patience 10。
六个 GluonTS 集、K=16、五随机种子。主指标 Distortion 是目标轨迹到最近假设的欧氏距离,越低越好。
| 方法 | Electricity | Exchange | Solar |
| TimeMCL (R.) | 12693±1772 | 0.0380±0.0025 | 292.15±11.68 |
| TimeMCL (A.) | 10335±767 | 0.0443±0.0051 | 308.16±14.87 |
| TimeGrad | 14255±1682 | 0.0576±0.0090 | 406.91±16.08 |
| TimePre | 7774±203 | 0.0275±0.0004 | 267.06±1.55 |
Electricity 上比 TimeMCL (R.) 低 38.8%,Exchange 低 27.6%。Traffic 0.68、Taxi 182.27、Wiki 263492,六项 Distortion 全第一。Wiki 对 TACTiS-2 的 263975 只赢一丁点。方差也小:Electricity 的 ±203 对 TimeMCL (R.) 的 ±1772。
CRPS-Sum(论文把数值乘了 100)上 TimePre 拿下 Electricity 3.15、Exchange 0.72、Wiki 6.14;Solar 39.79、Taxi 21.72 第二;Traffic 11.81 明显落后 TimeGrad 的 5.89。采样模型在整分布校准上仍有优势,代价是速度。
Exchange 上 TimePre 单次前向 0.03 秒、4.28×10^4 FLOPs;TimeGrad 64.2 秒、1.91×10^8 FLOPs;TimeMCL (R.) 1.97 秒。DeepAR 的 FLOPs 更低(2.90×10^4),Distortion 却到了 184424。
归一化对照(Electricity):BatchNorm 12447、LayerNorm 9453、RevIN 8106、SIN 7774。头利用率更刺眼:均值缩放、GroupNorm、InstanceNorm 只剩 1 个活跃头,RevIN 5 个,SIN 6 个。Traffic 上 SIN 相对 RevIN 把赢家熵抬了 1.0 bit。隔离实验里,线性骨干配均值缩放在 K=1、还没有 WTA 时 Distortion 已经是 68670,换 SIN 掉到 9626;LSTM 配均值缩放在 K=1 还能撑住 18000。换更重骨干帮不上忙,TiDE 变体在 Solar 上 Distortion 飙到 478.26。
给要上线概率预测、又受不了扩散采样延迟的人看。电负、交通、汇率这类场景,0.03 秒一批对 64 秒不是同一量级。骨架几乎就是 DLinear 加修剪版 RevIN 加多头,六套数据共用一套超参,没有逐集搜。
这是渐进改进。作者自己写了:SIN 不是新机制,只是把修剪统计量塞进可逆实例归一化。能带走的判断更窄:线性骨干做 MCL 会塌,锅在尺度,先把归一化做对。
作者列了三条。SIN 对 RevIN 的优势因数据集而异,Wiki 上赢家熵还略低。置信头用赢家识别交叉熵,不是 proper scoring rule;Electricity 上 AUROC 只有 0.410,argmax 准确率 0.029,还不如多数类基线 0.286。评测只覆盖六个固定视野的 GluonTS 集,通道独立假设直接丢掉变量间依赖。
SIN 接到 TimeMCL 原 LSTM 上的对照是单一种子诊断,Taxi 和 Wiki 上甚至超过五种子平均的 TimePre,这个对照强度不够。Traffic 的 CRPS-Sum 落后 TimeGrad 一大截,K 条离散轨迹盖不住完整条件分布。Solar 远视野退化比到 5.42×,论文归因日夜周期,别的昼夜强周期序列会不会同样炸,没有再测。