Valeo 用 5500 小时驾驶视频,拟合视频扩散模型 scaling law
abursuc · x · 2026-09-10
VATIX 是 valeo.ai 在 ECCV 2026 DriveX workshop 介绍的研究项目:《5500 小时驾驶能走多远?视频扩散模型的 scaling law 分析》。
研究动机:自动驾驶视频生成不能照搬 LLM 的 web-scale 路线——驾驶数据采集昂贵、受隐私限制、独特覆盖有限,且扩散模型的训练动态与 scaling 行为和 LLM 不同。核心问题是:给定固定驾驶数据集,该如何分配算力来改进视频生成?
- 数据:来自 Natix 数据集约 5500 小时真实驾驶视频,覆盖欧洲、北美、日本 28 国,前视摄像头,人脸与车牌已匿名化,约 630 万个 2.5 秒片段,9 帧率,320×416 分辨率。
- 实验规模:200+ 次训练,参数从 160 万到 11 亿 用于拟合 scaling law,对 9B 外推误差仅 3.6%。
- 三条 scaling law:模型规模律(loss 随参数量变化)、训练律(随样本曝光变化)、算力分配律(固定算力下如何在模型大小与曝光之间分配),目标指标为验证扩散损失,拟合形式 L(x)=L0+A·x^(-α)。
项目已开源论文、代码、模型与数据集,并给出真实与生成驾驶片段的对比示例。
「多模态」频道最新
- Reddit 网友用 Astra + Higgsfield 生成完整 2D 平台游戏,连音效配乐都自动搞定 — Critical-Home9648 · 2026-09-10
- 同一提示词对决:Suno V6 对阵 Google Lyria 3.5 — jordiponsdotme · 2026-09-10
- Seedance 2.5 真实感再进化,博主晒 prompt:逼真到「忘了这是 AI」 — umesh_ai · 2026-09-10
- Cartwheel MCP 携手 Astra:视频一键重建 3D 场景可用于机器人训练 — andrew_n_carr · 2026-09-10
- Minimax H3 实测:50 步基线对比 8 步 Turbo LoRA 皮肤质感 — rm_rf_all_files · 2026-09-10
- Open Actor Protocol 提议:为各自为战的 AI 电影制作定标准 — TheChuckTone · 2026-09-10