StreamMAE 让自监督学习直接吃连续视频流,扩到 95 小时仍持续增益
y_m_asano · x · 2026-10-09
NeurIPS 2026 论文《I Have a Stream: Making Self-Supervised Learning Work on Continuous Video》,作者 Ivan Martinović、Lukas Knobel、Yuki M. Asano(纽伦堡技术大学 Fundamental AI Lab 等)。
问题与设定
- 标准自监督训练独立采样、全局打乱,与婴儿视觉学习方式相去甚远;论文研究按时间顺序消费连续视频流、严格滑动窗口批、无全局重排与多轮回放的设定
- 构建 WT++ 数据集:95 小时城市步行游览视频,用于流式预训练
发现
- 对比学习与蒸馏类方法在流式设定下表现挣扎;MAE 更稳健但仍不及 i.i.d. 预训练
- 主要瓶颈不是批间高相似,而是批内高相似(批内帧近乎重复)
方法与结果
- StreamMAE 保留 MAE 重建目标,加入流感知正则与运动偏置裁剪选择
- 超过流式基线、追平同数据 i.i.d. MAE,与 ImageNet 预训练 MAE 具竞争力;预训练流从 12 小时扩到 95 小时增益持续
- 作者补充:DINO 等 SSL 方法在流式场景表现不佳;附 probing vs 全量微调等对比;代码与 WT++ 即将发布
所属事件:NeurIPS 论文 StreamMAE 让自监督学习直接消化连续视频流(4 条相关)→
「研究」频道最新
- 数据公司需自建前沿级训练设施,Proximal 公开后训练技术栈 — AccBalanced · 2026-10-10
- AI Agent 遗漏 1400 万美元条款,Surge AI 发布 Excel 基准 GDP.xlsx — echen · 2026-10-10
- Calico 开源 Cerberus 基因组模型:786kb 输入预测 8000+ 轨迹,迁移 PyTorch — anshulkundaje · 2026-10-10
- 状态空间模型用于长序列基因组预测,开源 Cerberus PyTorch 模型集 — anshulkundaje · 2026-10-10
- MaCVi 海事计算机视觉工作坊登录 WACV 2027,10 月截稿 — HildeKuehne · 2026-10-10
- OpenAI 将 722 篇数学手稿推上 GitHub,外界模型无法使用 — thursdai_pod · 2026-10-10