预测一千只美股全变平线:时序基础模型的「预测塌缩」被算出了理论边界

Forecast Collapse in Time-Series Foundation Models

Shu Wan, Miles Ma, Hank Zhu, Guangqi Liu, Stephen Wang, Qingsong Wen, Huan Liu

cs.LG, cs.AI, cs.CE, stat.AP, stat.ML

2026-08-14

用 MSE 训练的时序模型预测美股收益时输出几乎平线、选股排序接近失效,论文证明这是低可预测性与逐序列目标的必然结果,并用 CalibRank 损失把排序相关性提升近三倍且幅度不失控。

这篇在解决什么

拿一个时序基础模型(TSFM,在大规模多域数据上预训练、零样本即可预测的通用预测模型)去预测 1000 只美股的小时收益率,会发现一个尴尬现象:预测曲线几乎是平的,而且它给股票排序的能力很差,按横截面相关(每个时间点上 1000 只股票的预测值与真实收益的相关系数,量化圈叫 IC)衡量,基本在 0.05 附近挣扎。论文给这个现象起了名字:预测塌缩(forecast collapse)。

蹊跷的是,换成预测同一批股票的成交量变化,塌缩基本消失。同一个模型、同一套协议,换一个目标就换一种命运,说明问题不在架构。此前社区把平线输出当成模型缺陷或训练失败,这篇证明它是两个统计机制的必然结果,平线预测可能是对低可预测目标的正确校准响应。

方法

两条机制分别被形式化:

两件事叠加出一个校准—排序权衡:纯 MSE 输出校准但平,纯 IC(直接优化横截面相关)排序好但幅度不受控。解法 CalibRank 朴素到一行:损失函数等于 MSE 项加上带系数 λ 的可微 Pearson 相关项,前者锚定尺度,后者奖励排序。λ 在验证集上按日期切分后选定,扫出的前沿显示第一个非零排序权重就贡献了几乎全部 IC 增益,之后的 λ 主要推高幅度和误差。

结果

对照实验在自建基准 Finance1K 上做:1000 只美股 2015 到 2026 年的 28,510 个小时级观测,收益与成交量两个目标对齐,前 19,957 步训练、后 8,553 步测试。统一协议横跨 12 个主流预测架构(DLinear、PatchTST、iTransformer、Autoformer、Non-stationary Transformer 等):

训练目标幅度(相对目标)横截面 ICMSE
MSE0.0270.0464.30×10⁻⁴
纯 IC25.260.1244.22×10⁻¹
CalibRank1.8360.1261.43×10⁻³

IC 从 0.046 提到 0.126(参考编码器上提升近三倍),同时幅度保持在目标的两倍以内;纯 IC 训练把排序做到 0.124 却付出 25 倍目标幅度、比 CalibRank 高两个数量级的误差。12 个骨干架构全部受益,平均 IC 从 0.062 升到 0.123。不在损失里的下游检查(多空决策组合的 held-out 收益)从 0.052 升到 0.170。零样本测试 TimesFM 和 Chronos 在 97 个 GIFT-Eval 配置上,原始幅度与可预测性的相关高达 0.88/0.87:R²≥0.30 的 65 个配置里模型保留约四分之三目标幅度,R²<0.05 的 6 个配置里只剩不到 6%。负对照是成交量目标,MSE 本身幅度 0.391、IC 0.530,CalibRank 只小幅提升,可预测性充足时塌缩根本不出现。

为什么重要

对做量化或任何多序列决策场景的人,这篇给出一个可执行的审计清单:先估目标的可预测上限(用一组拟合基线的 achieved R² 做下界),低 R² 加上决策依赖跨序列结构,两个条件同时满足就是塌缩高危区。改架构救不了幅度,加一个匹配的横截面损失项才动得了排序。CalibRank 的实现只是一个损失函数改动,不动骨干网络,任何现有训练管线都能加。更广的提醒是评测层面:GIFT-Eval 的 97 个配置里 43 个是多变量,但评测时全部拉平成单序列打分,十一个指标没有一个量原始幅度或跨序列结构,逐序列指标可以完全掩盖下游真正需要的信息。

局限与存疑

作者自己列的:幅度恒等式对最优缩放后的预测是精确的、在仿真里验证过,但 GIFT-Eval 那部分只是两个预训练模型的关联性证据,achieved R² 是下界,并没有真正检验定理的上界不等式;横截面诊断和补救只在一个真实面板(金融)上做过,12 架构实验排除了单架构解释,但不保证其他领域有同样的排序失效;CalibRank 只针对每个时间点的 Pearson 相关这一个依赖泛函,关心排序、尾部或校准情景的应用需要换别的横截面项,且要求每个时间点有足够大的截面,单序列场景不适用。读下来还有两点要留意:决策收益的 0.052→0.170 看着大,但论文没有给交易成本后的净收益,实盘含义要打折;IC=0.126 换算成命中率约 51.6%,这个量级的相关在量化里有意义,但幅度仍差目标近一倍,部署前需要在验证集上按幅度容差选操作点。

术语

原文与代码

社区讨论

相关论文

全部论文解读