UniMotion 统一运动、文本与视觉,SOTA 七项任务
jiqizhixin · x · 2026-08-23
UniMotion 是一个统一的运动-文本-视觉理解与生成框架。它将人体运动视为连续信号而非分块 Token,将运动和图像在共享语言模型中并置,实现文本、视频和姿态的无缝互信息。通过两种巧妙的对齐技巧,它可以在测试时无需图像即可学习运动,并利用纯运动数据进行训练。该模型在 7 项运动-文本-视觉任务上取得最佳成绩,尤其擅长处理复杂的跨模态组合,如从文本生成运动或通过姿态编辑图像。
「具身」频道最新
- 中国机器人百米跑 9.32 秒,逼近博尔特纪录 — minchoi · 2026-08-23
- 机器人解锁新技能:已能攀爬陡峭楼梯 — Dr_Singularity · 2026-08-23
- RTX 5090 跑 Minimax H3:20 步 12 秒 — Grinderius · 2026-08-23
- 中国机器人实现 14.5m/s 奔跑速度,专家称未留退路 — kevinakwok · 2026-08-23
- 机器人 VR 遥操涂果酱:4ms 延迟 60Hz 实测 — neurosp1ke · 2026-08-23
- WHRG’26 首次直播人机双打网球赛,Galbot 机器人登场 — Distinct-Question-16 · 2026-08-23