NVIDIA 刘明宇谈 Cosmos 3:一个模型统一视频生成与机器人动作
Machine Learning Street Talk · rss · 2026-09-16
Machine Learning Street Talk 采访 NVIDIA Cosmos 研究负责人刘明宇(Ming-Yu Liu),详解 Cosmos 3 全模态世界模型——片头那段左转汽车从未被拍摄,完全由模型生成。
核心内容:
- 架构:视觉语言模型逐 token 推理,其权重初始化一个双向扩散生成器,统一输出视频、音频与机器人动作;共享时间位置编码对齐不同频率的信号。
- 世界观:把「世界模型」当一组工具而非单一系统——前向动力学、逆动力学与策略在容量限制下联合训练、互相促进。
- 数据:第一人称人类视频可迁移到数据稀缺的机器人;在 DROID 数据集上后训练的 Cosmos 模型是抓放策略的好起点。
- 测试:神经模拟器不需精确成功率,只需像真实世界一样给策略 A/B 排序,帮团队筛出值得真机试跑的 checkpoint;Cosmos Dreams 将闭环思路用于驾驶与机器人。
- 三个尺寸:Super、Nano、Edge(Edge 面向 Jetson Thor、Orin、DGX Spark),开放权重、代码与数据均已发布。本期为 NVIDIA 赞助内容。
「具身」频道最新
- 开源 3D 打印机械臂 Maker Arm 开售:6 轴 1.5kg 载重,999 美元起 — IsaiahBallah · 2026-09-16
- 中国公司发布逼器仿生机器鱼,可混入鱼群执行水下监控 — Polymarket · 2026-09-16
- 双臂 ALOHA 机器人演示解连锁机关与三环穿绳任务 — jiqizhixin · 2026-09-16
- 原力灵机 DM0.5 横扫六套具身评测,RoboColiseum 四榜全第一 — 机器之心 · 2026-09-16
- 机器人 GPT 会就是 GPT 本身:机器人专家实测通用模型操纵能力 — chris_j_paxton · 2026-09-16
- U-BOT 机器人 MuJoCo 航点跟踪仿真画面精致到像假 — _Stocko_ · 2026-09-16