NVIDIA Cosmos 3 负责人详解:一个模型同时生成视频、理解视频并输出机器人动作
Machine Learning Street Talk · youtube · 2026-09-16
Machine Learning Street Talk 采访 NVIDIA Cosmos 研究负责人刘明宇(Ming-Yu Liu),开头那段左转汽车画面从未被拍摄——由 Cosmos 3 生成。他解释了一个模型如何同时描述视频、生成视频并产生机器人动作。
架构:视觉语言模型逐 token 推理,其权重随后初始化一个双向扩散生成器,统一生成视频、音频与动作;共享的时间位置编码方案把不同频率的信号对齐到同一时钟。
世界模型观:Liu 把「世界模型」视为一组工具而非单一定义——前向动力学、逆向动力学与策略(policy)在容量限制下联合训练,彼此促进。
数据迁移:海量的第一人称人类视频可以迁移到数据稀缺的机器人上;在 DROID 数据集上后训练的 Cosmos 模型是抓放(pick-and-place)策略的良好起点。
测试思路(最实用的一条):神经模拟器不需要精确的成功率,只需像真实世界一样把策略 A 排在策略 B 之上,团队据此筛选值得真机试跑的 checkpoint。Cosmos Dreams 将这套闭环思路用于驾驶与机器人安全;Liu 认为人形机器人在儿童和宠物身边时,安全比汽车更重要。
模型尺寸:Super、Nano、Edge 三档,Edge 面向 Jetson Thor、Orin 与 DGX Spark;权重、代码与数据均已开放。本集为与 NVIDIA 的付费合作内容。
所属事件:NVIDIA Cosmos 3 世界模型让机器人先仿真再行动(3 条相关)→
「具身」频道最新
- M5 Ultra 首个跑分:多核 52516,比 M3 Ultra 快约 35% — jedisct1 · 2026-09-16
- 李飞飞 World Labs 招聘机器人学习研究员,聚焦世界模型 — YunzhuLiYZ · 2026-09-16
- Figure 创始人晒新一代机器人 F.03 亮相 Dreamforce — adcock_brett · 2026-09-16
- 自动驾驶数十年未解:实时闭环反馈不是便宜感知能替代的 — GlenBerseth · 2026-09-16
- Light Origins 展示人形机器人零样本穿越复杂地形 — chris_j_paxton · 2026-09-16
- Einride 无驾驶室 L4 自动卡车获德国 KBA 首证,为 Lidl 日常送货 — FlorianGallwitz · 2026-09-16