95 小时视频流预训练,StreamMAE 追平 i.i.d. 训练

I Have a Stream: Making Self-Supervised Learning Work on Continuous Video

Ivan Martinović, Lukas Knobel, Yuki M. Asano

NeurIPS 2026

cs.CV

2026-10-01

连续视频流按序预训练,StreamMAE 只改数据管线就追平同数据 i.i.d. MAE,流从 12 小时扩到 95 小时持续涨点。

这篇在解决什么

主流自监督预训练(MAE、DINO、MoCo)隐含一个前提:数据可以全局打乱,每个 batch 由互不相关的图片组成,近似 i.i.d. 采样。机器人、可穿戴设备、边缘摄像头看到的画面不长这样,帧按时间顺序到来,相邻帧几乎是同一张图,也没条件存下来反复过 epoch。这篇问得很干净:从随机初始化出发,不全局打乱、不多轮重放、不维护 replay buffer,自监督学习在连续视频流上还能不能训出好表征。为此作者把 WalkingTours 数据集扩成 WT++:58 段公开城市步行视频、共 95 小时。用 DINOv2 特征算 512 帧的两两相似度,连续帧均值 0.95,随机抽帧只有 0.18,流式与打乱训练的分布差距一目了然。

方法

先诊断。三类目标各跑一遍流式预训练(ViT-S,12 小时流):MoCo v3 在 ImageNet-1K 上只有 68.7,低于随机初始化的 71.9,近重复帧在对比学习里直接成了假负样本;DINO 72.7,勉强过随机线;MAE 最稳,但密集预测掉得多、模型越大掉得越狠,ViT-B 在 Cityscapes 上差出近 10 个 mIoU(58.2 对同数据 i.i.d. 的 67.8)。带重放缓冲的 MemoryStoryboard 复现也只有 71.0,救不回来。底座定为 MAE。

归因实验是全文最漂亮的一步。流式与 i.i.d. 差在两处:相邻 batch 大量重叠(inter-batch 相似度),以及 batch 内部全是近重复帧(intra-batch 相似度,WT++12h 上 0.665,ImageNet 随机 batch 只有 0.004)。作者把 ImageNet-1K 预先打乱一次,再按固定滑窗顺序消费,inter-batch 相似度 0.989、几乎复刻真视频流,intra-batch 仍是 0.004,结果这套「假流」与标准 i.i.d. MAE 完全打平(ViT-S 上 77.4 对 77.4)。批次间重叠无害,杀手是批内近重复帧。梯度分析同向:连续 batch 的梯度余弦相似度越接近 i.i.d. MAE 的近零水平(均值 0.04),下游越好,流式 MAE 是 -0.11,StreamMAE 拉回 0.01。

StreamMAE 由此而来,MAE 目标一行不改,改的全是输入管线:

结果

方法(ViT-S,WT++12h)IN-1K Acc@1Cityscapes mIoUADE20K mIoU
随机初始化71.947.716.7
MoCo v3(流式)68.752.019.4
MAE(流式)77.161.323.9
MAE i.i.d.(同数据)77.063.525.9
StreamMAE77.563.826.1
StreamMAE(95h 流)78.468.029.5

12 小时流上追平同数据 i.i.d. MAE,规模上去后开始反超:ViT-B 在 12 小时流上 Cityscapes 69.0,高于同数据 i.i.d. 的 67.8;95 小时流加 ViT-B 拿到 IN-1K 82.0、Cityscapes 74.0、ADE20K 36.5,与迭代数对齐的 ImageNet-1K i.i.d. MAE(81.5/72.3/35.9)互有胜负。消融从流式 MAE 的 Cityscapes 60.8 做到 63.8,正则和裁剪贡献大头。冻结表征做 attentive probing,比流式 MAE 高 6.8(ViT-S)、9.8(ViT-B)个点。

scaling 有两个硬结论:采样从 3.75 FPS 提到 15 FPS、更新步数翻四倍,Cityscapes 反而从 69.0 掉到 65.2;同一流重复两遍(70.3)不如直接喂新视频(25 小时,72.5)。收益来自新场景,不来自更多梯度步。跨域也成立,HD-EPIC(室内厨房第一视角)、CROWD(行车记录仪)、KrishnaCAM(头戴日常)三个流上全面超过流式 MAE,分割涨 1.65.8 mIoU。

为什么重要

对具身智能和边缘设备这类数据只来一次、按序到达、不值得存储的场景,这是第一个从零训练就追平 i.i.d. 的完整配方,代价还低:目标函数不动,改的都是数据管线。归因结论单独就有复用价值:训练数据若是高冗余流(日志、传感器、直播),对比学习和自蒸馏可以直接排除,掩码重建是正确起点;工程上先解决批内多样性,批间重叠不用管。也得说清,这是渐进式改进,组件全是已知技术,新意在组合动机来自受控归因实验。

局限与存疑

论文没有独立的 limitations 小节,以下一半来自作者自述,一半来自读数:

术语

原文与代码

社区讨论

相关论文

全部论文解读