UMO 统一框架解锁动作基础模型先验,横扫多种人形动作任务
Michael_J_Black · x · 2026-09-11
布朗大学、MIT、Max Planck、Meta Reality Lab 与港大合作的人形动作生成论文 UMO(ECCV 2026)在 poster session 展出。
- 核心思路:以预训练的 3D text-to-motion 基础模型为底座,通过统一的 in-context learning 框架扩展到多个下游动作生成任务,用三种 meta-operations 覆盖多样化任务。
- 任务覆盖:域内的 text-to-motion 生成,以及域外的时间修补类任务(keyframe infilling、预测、backcasting、in-betweening 等),演示样例包括华尔兹、倒立、运球上篮等复杂连续动作。
- 结果:性能优于各任务专用 baseline,作者称统一框架解锁了 motion foundation model 先验。
- 署名:包含 Michael J. Black、Wojciech Matusik 等知名研究者,论文、代码与 arXiv 链接均已公开。
「具身」频道最新
- 机器人 Reachy Mini 被纳入 NVIDIA 组合后不再低调 — RachelVT42 · 2026-09-11
- 南洋理工系初创 Ropedia 融资 3000 万美元,用可穿戴设备给机器人喂数据 — liuziwei7 · 2026-09-11
- 机器人圈为何对 AGI 集体沉默:能洗碗洗衣再说 — MannyKayy · 2026-09-11
- Dyna-2百万小时数据背后:Maxinsights成硅谷机器人「供血商」 — 新智元 · 2026-09-11
- 实拍中国光电展:XR 供应链上游供应商全景速览 — Scobleizer · 2026-09-11
- 无方向盘无踏板:特斯拉 Cybercab 无人出租车首次亮相日本 — yunta_tsai · 2026-09-11