I Have a Stream: Making Self-Supervised Learning Work on Continuous Video
Ivan Martinović, Lukas Knobel, Yuki M. Asano
NeurIPS 2026
cs.CV
2026-10-01
连续视频流按序预训练,StreamMAE 只改数据管线就追平同数据 i.i.d. MAE,流从 12 小时扩到 95 小时持续涨点。
主流自监督预训练(MAE、DINO、MoCo)隐含一个前提:数据可以全局打乱,每个 batch 由互不相关的图片组成,近似 i.i.d. 采样。机器人、可穿戴设备、边缘摄像头看到的画面不长这样,帧按时间顺序到来,相邻帧几乎是同一张图,也没条件存下来反复过 epoch。这篇问得很干净:从随机初始化出发,不全局打乱、不多轮重放、不维护 replay buffer,自监督学习在连续视频流上还能不能训出好表征。为此作者把 WalkingTours 数据集扩成 WT++:58 段公开城市步行视频、共 95 小时。用 DINOv2 特征算 512 帧的两两相似度,连续帧均值 0.95,随机抽帧只有 0.18,流式与打乱训练的分布差距一目了然。
先诊断。三类目标各跑一遍流式预训练(ViT-S,12 小时流):MoCo v3 在 ImageNet-1K 上只有 68.7,低于随机初始化的 71.9,近重复帧在对比学习里直接成了假负样本;DINO 72.7,勉强过随机线;MAE 最稳,但密集预测掉得多、模型越大掉得越狠,ViT-B 在 Cityscapes 上差出近 10 个 mIoU(58.2 对同数据 i.i.d. 的 67.8)。带重放缓冲的 MemoryStoryboard 复现也只有 71.0,救不回来。底座定为 MAE。
归因实验是全文最漂亮的一步。流式与 i.i.d. 差在两处:相邻 batch 大量重叠(inter-batch 相似度),以及 batch 内部全是近重复帧(intra-batch 相似度,WT++12h 上 0.665,ImageNet 随机 batch 只有 0.004)。作者把 ImageNet-1K 预先打乱一次,再按固定滑窗顺序消费,inter-batch 相似度 0.989、几乎复刻真视频流,intra-batch 仍是 0.004,结果这套「假流」与标准 i.i.d. MAE 完全打平(ViT-S 上 77.4 对 77.4)。批次间重叠无害,杀手是批内近重复帧。梯度分析同向:连续 batch 的梯度余弦相似度越接近 i.i.d. MAE 的近零水平(均值 0.04),下游越好,流式 MAE 是 -0.11,StreamMAE 拉回 0.01。
StreamMAE 由此而来,MAE 目标一行不改,改的全是输入管线:
| 方法(ViT-S,WT++12h) | IN-1K Acc@1 | Cityscapes mIoU | ADE20K mIoU |
| 随机初始化 | 71.9 | 47.7 | 16.7 |
| MoCo v3(流式) | 68.7 | 52.0 | 19.4 |
| MAE(流式) | 77.1 | 61.3 | 23.9 |
| MAE i.i.d.(同数据) | 77.0 | 63.5 | 25.9 |
| StreamMAE | 77.5 | 63.8 | 26.1 |
| StreamMAE(95h 流) | 78.4 | 68.0 | 29.5 |
12 小时流上追平同数据 i.i.d. MAE,规模上去后开始反超:ViT-B 在 12 小时流上 Cityscapes 69.0,高于同数据 i.i.d. 的 67.8;95 小时流加 ViT-B 拿到 IN-1K 82.0、Cityscapes 74.0、ADE20K 36.5,与迭代数对齐的 ImageNet-1K i.i.d. MAE(81.5/72.3/35.9)互有胜负。消融从流式 MAE 的 Cityscapes 60.8 做到 63.8,正则和裁剪贡献大头。冻结表征做 attentive probing,比流式 MAE 高 6.8(ViT-S)、9.8(ViT-B)个点。
scaling 有两个硬结论:采样从 3.75 FPS 提到 15 FPS、更新步数翻四倍,Cityscapes 反而从 69.0 掉到 65.2;同一流重复两遍(70.3)不如直接喂新视频(25 小时,72.5)。收益来自新场景,不来自更多梯度步。跨域也成立,HD-EPIC(室内厨房第一视角)、CROWD(行车记录仪)、KrishnaCAM(头戴日常)三个流上全面超过流式 MAE,分割涨 1.65.8 mIoU。
对具身智能和边缘设备这类数据只来一次、按序到达、不值得存储的场景,这是第一个从零训练就追平 i.i.d. 的完整配方,代价还低:目标函数不动,改的都是数据管线。归因结论单独就有复用价值:训练数据若是高冗余流(日志、传感器、直播),对比学习和自蒸馏可以直接排除,掩码重建是正确起点;工程上先解决批内多样性,批间重叠不用管。也得说清,这是渐进式改进,组件全是已知技术,新意在组合动机来自受控归因实验。
论文没有独立的 limitations 小节,以下一半来自作者自述,一半来自读数: