近万亿条秒级美股上,预测与结构排名相关仅 -0.19

Towards Financial World Modeling

Humzah Merchant, Alec Guthrie, Simon Mahns, Randall Balestriero, Bradford Levy

cs.LG

2026-10-07

芝大等发布 Market-1T,在 2008–2025 美股秒级数据上比 18 种编码器:多头监督 15 分钟收益 rank IC 0.031,价差上自监督全输给随机 ViT,预测与结构排名相关仅 -0.19。

这篇在解决什么

世界模型要的状态,得应付训练时还不知道的决策:市场 regime、个股预期收益、流动性、波动、资产之间怎么联动。金融表征以往多按单任务打分,数据常常只有几个月或一个固定股票池。同一编码器的 rank IC 在 2008 到 2025 各段起伏很大,单月榜经常测的是那段行情好不好猜。

DINO-WM 在预训练特征上学生成动态,V-JEPA 2 做带动作的预测,LeWM 可以连表示一起训。这篇只补表示层。动态和规划没有做。

方法

Market-1T 由芝加哥大学 Booth 与 Massive 合作建成:2008 到 2025 年美国上市股票,一秒一条,近一万亿条。2008 是 Reg NMS 后第一个完整年。来源为 CTA 与 UTP 的 SIP,即 NBBO 加合并成交。每秒 11 个字段:买卖价和量、开高低收、VWAP、成交量、成交笔数。按规则可以聚成更粗频率,不用插值。

股票池每月只用上一个月重算,避开幸存者偏差和前视:普通股,月均 VWAP 高于 5 美元,日均成交额至少 2000 万美元,常规时段超过 20% 的秒有活动,每天约 700 只。价格共用均值和方差,价差才不会被拆掉。量取 log(1+x)。统计量只来自训练段。

评测抽 32 个月,训练只用此前六个月。超参在另外 5 个月上选,每个方法最多约 125 次调参。骨干为 ViT-Small,岭探针接在最后 token,潜空间用均值池化。主结果用满探针样本,因为 IC 随样本量明显上升。information token 带上归一化参数、起止时间和聚合尺度,时序基础模型不接收。监督损失是成对 learning-to-rank。一次训练约 1 到 2 个 H100 小时。

自监督对齐视图数量。目标包括 DINO、BYOL、CPC、I-JEPA、MAE、TS2Vec、CoST、TF-C、TimeMAE。五种增广主要用 LeJEPA 比较,DINO 和 BYOL 默认时间扭曲。同一股票的不同裁剪会靠盘口量记住公司;时间扭曲更换聚合尺度;同一时刻的跨股票视图奖励共同运动;同行业配对用 Fama-French 49 行业。高斯噪声作对照。

结果

15 分钟 rank IC,32 个月平均。专用头一行是三个任务各自的监督头。

方法收益波动变化价差变化
多头监督0.03110.09410.2455
该任务专用监督头0.02720.08830.2517
TS2Vec0.02050.07190.1500
LeJEPA 时间扭曲0.02040.07210.1691
随机 ViT0.01700.06940.1692
DINO0.00970.03100.0626
TimesFM 3.0 冻结0.02320.09470.1362
Chronos-2 冻结0.02300.09280.1289

多头收益 0.0311,高于专用头 0.0272;波动 0.0941,高于 0.0883。价差专用头 0.2517,多头略低,为 0.2455。收益和波动共用表示,价差略降。

自监督相对随机 ViT,收益上最好是 TS2Vec 的 0.0205,对 0.0170;波动上时间扭曲 0.0721,对 0.0694。价差上全部自监督不超过随机 ViT 的 0.1692。DINO 价差只有 0.0626。

TimesFM 3.0 的波动 0.0947,略高于多头,收益 0.0232。价差 0.1362,Chronos-2 为 0.1289,都低于随机 ViT,也低于原始序列 ARDL 岭回归的 0.1857。24 token 尾部岭回归的收益已有 0.0196。监督真正拉开的是价差:专用头 0.2517,64 token 岭回归 0.1820。

月份解释三个任务变动的 97.2%、98.9% 和 99.9%。固定 FLOPs 时,ViT-Tiny(540 万参数)在三项上都胜过 FLOPs 为其 10 倍的 ViT-Base(8600 万)。相对靠近评估月重训的模型,五年里波动 IC 约掉基准的 20%,价差约 10%,收益更稳。

预测名次和组织名次的 Spearman 相关为 -0.19。同一股票不同时间的 LeJEPA,公司检索达到随机的 5.36 倍(百分位 2.5%),交易日检索只有 1.31 倍(百分位 46%)。两套质心强负相关。监督嵌入的 RankMe 只有 2.8 到 3.7,LeJEPA 约 11 到 15,随机 ViT 为 43.2。多头是唯一在各项结构探针上都超过随机 ViT 的训练模型。

2,448 套组合里,选股、加权、再平衡和 EFQ 对 Sharpe 的影响大于编码器。EFQ 从 0%(近乎中间价)到 100%(付满报价价差),IC 与平均 Sharpe 的相关从 +0.92 降到 +0.46。锁死一套回测,相关只剩 +0.52 到 +0.29。EFQ 为 100% 时,再平衡一项就让年化 Sharpe 极差达到 24.7。

为什么重要

月份占了 97% 以上的方差。只看最近一年,排的是行情。随机 ViT 加用满样本的岭探针已是地板,DINO、BYOL、I-JEPA 掉在下面。

增广选定几何:同一资产的视图记住公司,跨股票视图留下当天的共同运动。多头是唯一在各项结构探针上都超过随机地板的训练模型,有效秩约 3.7,更接近低维预测。固定算力下 ViT-Tiny 更好,单次大约 1 到 2 个 H100 小时,重训做得到。

比表示应看 rank IC。Sharpe 先被回测套件决定。直接接入市场的 EFQ 大约 55%,纽交所路径可到 88%。只用价量,信号不一定盖得过价差。

局限与存疑

动态和带动作的规划都没有训练,DINO-WM、V-JEPA 2 和 LeWM 都还没在这套状态上跑过。组织排名和预测排名不一致,只说明不能单靠下一步收益验收,没有证明这些探针能提高规划。

18 种策略混着 4 个监督头、5 种增广和 9 个目标。增广细扫集中在 LeJEPA。其他目标配上跨股票视图会不会改名次,表上没有。输给随机 ViT,有一部分可能是增广没配对。

表内是流动普通股,5 美元和 2000 万美元两条线以下的名字被排除,也没有多档订单簿。价差写在当前报价里,随机 ViT(0.1692)和 64 token 岭回归(0.1820)都能读到,不变性目标容易把它丢掉。

其余方法只报最后一层,基础模型的中间层对照并不公平。监督侧多一枚 information token。结论写明,完整数据集的集中托管当时仍在准备,预训练编码器已另行放出。32 个月测的仍是大约 15 分钟的价量。

术语

原文与代码

社区讨论

相关论文

全部论文解读