UniMotion 统一运动、文本与视觉,SOTA 七项任务

jiqizhixin · x · 2026-08-23

UniMotion 是一个统一的运动-文本-视觉理解与生成框架。它将人体运动视为连续信号而非分块 Token,将运动和图像在共享语言模型中并置,实现文本、视频和姿态的无缝互信息。通过两种巧妙的对齐技巧,它可以在测试时无需图像即可学习运动,并利用纯运动数据进行训练。该模型在 7 项运动-文本-视觉任务上取得最佳成绩,尤其擅长处理复杂的跨模态组合,如从文本生成运动或通过姿态编辑图像。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →