5500 小时驾驶视频训出 9B 扩散模型,Valeo 给出视频生成 scaling law

kwangmoo_yi · x · 2026-09-01

Valeo.ai 团队发布研究 VATIX:用 Natix 数据集约 5,500 小时、覆盖 28 个国家的真实前视驾驶视频(约 630 万段 2.5 秒片段,已匿名化),从零训练视频扩散模型,并对视频扩散的 scaling law 做系统分析。

核心问题:自动驾驶视频生成不能照搬 LLM 的网级数据路线——驾驶数据昂贵、隐私受限、覆盖有限。给定一个固定的驾驶数据集,算力应该花在哪?

方法:用 1.6M 到 1.1B 参数量、200 多次训练拟合计三条 scaling law——模型规模、训练曝光量、以及固定算力下二者的最优分配,拟合形式为 L(x)=L₀ + A·x^(−α)。

结果:从拟合曲线外推到 9B 模型的误差仅 3.6%。论文、代码、数据集开源,模型尚待放出;项目页展示了真值与生成驾驶片段的对比。

所属事件:Valeo 用 5500 小时驾驶视频揭示扩散模型缩放定律(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →