VideoMDM 入选 NeurIPS:仅用 2D 单目视频监督训练 3D 人体动作扩散模型
orlitany · x · 2026-10-10
Technion 与 NVIDIA 研究者的论文 VideoMDM 被 NeurIPS 接收,将在悉尼展示。
核心方法
- 提出仅用单目视频提取的精确 2D 关键点做监督来训练 3D 人体动作扩散模型(如 MDM),无需任何 3D 真值。
- 用预训练 2D-to-3D lifter 生成近似 3D 姿态作为「噪声教师」:对其加噪、在 3D 上去噪,再把预测重投影到 2D 与真实关键点比对来监督。
- 理论上证明在温和假设下,深度加权的 2D 重投影损失在期望上等价于直接 3D 监督;并把速度一致性等标准 3D 正则适配到 2D 设定。
结果
- HumanML3D 上 FID 0.88,接近全 3D 监督 MDM 的 0.54。
- Fit3D 上 MPJPE 比 WHAM 低 2 倍;NBA 数据集上人类偏好率 64% 胜过 MAS。
- 与仅在推理时做 2D-to-3D 提升的方法不同,VideoMDM 在训练中就学到连贯的 3D 动作流形。
「具身」频道最新
- Agility 亮相白宫峰会,游说降低人形机器人 Digit 部署门槛 — xmercury_one · 2026-10-10
- Airbus 直升机自主飞行应用曝光,开发者称全球最酷自治案例 — BrettKrieger12 · 2026-10-10
- 欧洲 15 台 AI 机器人进议会,却无人匹敌中国电网 8500 台订单 — ingliguori · 2026-10-10
- 没长腿的机器人也想要你一块肉,Linus 分享抓取机械臂趣图 — LinusEkenstam · 2026-10-10
- 开发者吐槽 Vision Pro 2:误触进度条、打字太难,喊话苹果出眼镜 — Kuprel · 2026-10-10
- 全本地 AI 玩偶开源:Whisper+Hermes 8B+Kokoro,零云端隐私对话 — msalsas · 2026-10-10