Meta 研究:用无标注原始视频 mid-training,语言模型多模态显著提升
kastnerkyle · x · 2026-10-10
Meta AI 论文(arXiv:2610.11019)探索用无字幕、无文本损失的原始网络视频作为预训练语言模型的 mid-training 数据。
- 方法:将视频帧编码为连续视觉 token,让 Qwen3-1.7B 预测下一个视觉 token,纯自监督训练
- 结果:在 4 个视频基准上平均提升 2.9 分,10 个图像基准上提升 5.1 分;14 个文本基准平均 48.9 vs 48.0,文本能力基本无损
- 训练动态:图像与视频增益在前 30% 训练内出现后趋于平台期,波动小于 0.5 分
- 对比发现:预测字幕不如下一视觉 token 预测,说明无需自动字幕的计算开销与标注噪声
「多模态」频道最新
- 「假视频水平已再上一个台阶」,AI 换脸逼真度引担忧 — rohanpaul_ai · 2026-10-10
- 设计师纯代码做发布视频:Remotion+Three.js+Suno 全流程拆解 — lmoroney · 2026-10-10
- AI 生成预告片夺得首届 250 万美元 Future Vision XPRIZE — DavidmComfort · 2026-10-10
- Reddit 网友整理 ComfyUI 与 MiniMax 图视频生成新手速查表 — wildmonkeywrangler · 2026-10-10
- HiDream-O1-Video-1.0 登顶图生视频榜第 6,1080p 带同步音频 — ArtificialAnlys · 2026-10-10
- AI 虚拟角色出演剧集《The Engagement》第 4 集上线 Rad TV — AIandDesign · 2026-10-10