LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Matthias Bethge
cs.CV, cs.AI, cs.LG
2026-08-26
LAION-BVD 从 CommonCrawl 收 13 亿视频链接,实际下载 8,000 万条、1,000 万小时。用其中 5,500 万合成字幕片段训 ViCLIP,整体平均比过滤后的 InternVid-10M 高 4.0 个百分点。
公开图文语料已经到十亿级,视频仍小一个数量级。InternVid 大约 700 万条视频、76 万小时,和 LAION-5B 那种图文规模没法比。视频难在处理:平台设限、存储和转码贵、还要切镜头、写字幕。没有足够大的开放视频,开源的视频-文本、音频-文本预训练只能反复吃同一批 YouTube 子集。
从截至 2024 年 3 月的 CommonCrawl WAT 里抽出平台视频链接,4.7B 候选滤到 YouTube、Vimeo、Dailymotion 的 1.3B URL。2,000 台虚拟机加住宅代理,尝试下载 1.3 亿条,成功率约 60%,得到 8,000 万条、1,000 万小时。收集阶段没有额外安全过滤,依赖平台审核。
验证实验没有用满 8,000 万条。随机抽 240 万条视频,丢掉短于 10 秒或长于 30 分钟的,用 PySceneDetect(阈值 30)切镜头,再丢掉几乎静止的片段,得到 5,500 万 clip。视频字幕用 Qwen3-VL-2B-Instruct,最多 32 帧,「20 词以内描述视频」。音频用 Audio Flamingo 3,「10 词以内描述声音」。另从全库抽场景变化关键帧,滤黑帧,直到约 3 亿帧,构成 BVD-I-300M,再用 DeepSeek-VL2-tiny 配字幕。
发布的是 URL、部分字幕,以及机构签署条款后的原始数据。YouTube 占 94%,英语约 57%,时长均值 7.7 分钟、中位 3.7 分钟。视频帧和 Re-LAION 的 CLIP 嵌入 FID 为 33.92,而 Re-LAION 两份独立抽样只有 0.16,说明视觉分布和图文网页不是同一摊。vlogs 与音乐只占 20% 和 17%,教育和科技也有可观份额,语种上俄语、西班牙语各约 8–9%。几乎 6% 的视频超过 30 分钟,长视频任务不是完全没数据。
ViCLIP L-14、同一套评测管道:
| 数据 | 见到样本 | K400 | 平均 |
| DataComp-1B(图平均当视频) | - | 61.2 | 53.2 |
| InternVid-10M-FLT | 10M | 61.8 | 58.0 |
| BVD-V-10M | 10M | 62.7 | 61.3 |
| BVD-V-50M | 50M | 63.3 | 62.0 |
相对 InternVid-10M-FLT,BVD-V-10M / 50M 在 50M samples seen 时整体平均高 3.3 / 4.0 个百分点。模型从 B/32 到 L/14、样本从 10M 到 50M,平均分单调上升。WiSE-FT 合并还能再抬一点。
音频上,纯 BVD-A-10M 训 CLAP,30M samples seen、431M 模型平均 46.8,超过纯 LAION-Audio 的 44.8,仍低于 LAION-Audio+AudioSet 的 56.6。看到 110M 样本后,同一 431M 模型到 48.7,UrbanSound8K 70.6。混入 AudioCaps+Clotho 时,BVD-A-1.7M 接近 LAION-Audio,仍略低。
图文 CLIP 是另一面:BVD 帧在 COCO 检索上最强,ImageNet 分类明显弱。ViT-B/16、300M 样本,BVD 的 COCO I2T R@5 为 0.80,DataComp 0.70;ImageNet-1k 则是 0.28 对 0.58。视频关键帧不像 ImageNet 那么「物体居中」。
这是目前公开渠道里能摸到的最大网页视频库之一。做开源视频-文本或音频-文本预训练,至少多了一个和 InternVid 同协议可对比的数据源,而且字幕管线写得很清楚,便于复现。
帧数据不要当 LAION-5B 的替代。它更像互补分布:检索好、ImageNet 差,适合拿来扩多样性,不适合单独冲分类榜。
真正配了字幕、拿来训模型的只是 240 万视频上的 5,500 万 clip,不是 1,000 万小时全量。字幕短、由小模型生成,风格偏稀、也会带上 captioner 偏见。评测停在对比学习,没有生成式视频模型。视听是分开训的,没有联合音画表征。下载靠住宅代理和平台 ToS 灰色地带,链接会失效。没有收集阶段安全过滤。英语和 YouTube 仍然主导。机构才能下原始视频,普通研究者多半只能拿到 URL 和字幕。