5500 小时驾驶视频训出 9B 扩散模型,Valeo 给出视频生成 scaling law
kwangmoo_yi · x · 2026-09-01
Valeo.ai 团队发布研究 VATIX:用 Natix 数据集约 5,500 小时、覆盖 28 个国家的真实前视驾驶视频(约 630 万段 2.5 秒片段,已匿名化),从零训练视频扩散模型,并对视频扩散的 scaling law 做系统分析。
核心问题:自动驾驶视频生成不能照搬 LLM 的网级数据路线——驾驶数据昂贵、隐私受限、覆盖有限。给定一个固定的驾驶数据集,算力应该花在哪?
方法:用 1.6M 到 1.1B 参数量、200 多次训练拟合计三条 scaling law——模型规模、训练曝光量、以及固定算力下二者的最优分配,拟合形式为 L(x)=L₀ + A·x^(−α)。
结果:从拟合曲线外推到 9B 模型的误差仅 3.6%。论文、代码、数据集开源,模型尚待放出;项目页展示了真值与生成驾驶片段的对比。
所属事件:Valeo 用 5500 小时驾驶视频揭示扩散模型缩放定律(3 条相关)→
「多模态」频道最新
- Runway 生成 15 秒纯黑白片头完整 Prompt — umesh_ai · 2026-09-01
- DreamX-Creator:7B 模型原生生成 2K 音视频 — GD-ML · 2026-09-01
- 如何生成含不同口音的多角色对话视频? — delveccio · 2026-09-01
- 多模态生成技巧:先用 Gemini 起草再用 Sol 修正 — A_K_Nain · 2026-09-01
- 日式体育挑战:30 秒实拍级视频生成 — SimplyAnnisa · 2026-09-01
- Seedance 2.5 升级:提升 AI 虚拟网红视频的一致性与故事性 — aftahi_ai · 2026-09-01