北大推UniMotion统一框架,将人体运动纳入多模态大模型
机器之心 · wechat · 2026-08-15
北京大学等团队提出 UniMotion,将连续人体运动作为独立模态纳入统一多模态模型(UMM),实现文本、运动与 RGB 的统一理解与生成。该论文已被 ECCV 2026 录用。
- 核心架构:基于 Show-o21.5B 构建,文本走离散 token 自回归,Motion 和 RGB 编码为连续 latent,通过 Hybrid Attention 和按模态路由的 LoRA 协调信号。
- 技术创新:提出 CMA-VAE 实现运动连续表示与视觉语义对齐,推理时可移除视觉编码器;使用 LRA(Latent Reconstruction Alignment)进行 Motion-to-Motion 自监督预校准。
- 任务覆盖:统一支持运动理解、生成、预测、编辑及视觉人体恢复等七项任务。
- 实验表现:在 HumanML3D 等数据集上表现有竞争力,展示了在复杂动作提示下更完整的语义执行能力。
「多模态」频道最新
- Seedance2.5 更新:现已支持 1080p 生成 — CurieuxExplorer · 2026-08-15
- Cartesia 发布 Sonic 3.6,优化印地语与新增乌尔都语支持 — nevrekaraishwa2 · 2026-08-15
- 生物学家 Sokrypton 推出 3D 蛋白质卡通风格生成 — sokrypton · 2026-08-15
- AI 工具构建 Skara Brae 居住地 3D 漫游展示 — NathanWilbanks_ · 2026-08-15
- AI 生成 J-35 与阵风战机超写实空战视频 — SimplyAnnisa · 2026-08-15
- ComfyUI 0.33破坏H3 Motion Context,作者发布修复并解析上游变化 — Sad_Berry_4621 · 2026-08-15