AnyBody: Free-Form Whole-Body Humanoid Control from Arbitrary Keypoint Guidance
Shuning Li, Sikai Li, Jiachen Li, Mingyu Ding
cs.RO, cs.AI
2026-06-28
用一个球面潜在表示,任意几个关键点(哪怕一个手腕)就能驱动人形全身;单点跟踪成功率 93.7%,不再需要全身动捕。
让人形机器人全身控制摆脱「必须穿戴全身动捕服」的束缚。此前基于物理仿真的人形跟踪器要么依赖昂贵的全身动捕加上容易出错的轨迹重定向(retargeting),数据采集和策略学习都被卡住;要么把上半身和下半身拆成两套层级表示分别控制,丢掉了「走的同时伸手」这类需要全身协同的动作。AnyBody 想要的是:给任意一组身体关键点(哪怕只有一个手腕、或只给躯干),控制器就能合成出协调的全身动作。
核心是一个被任意关键点子集共享的潜在运动表示。训练分三步。
第一步先训一个带特权信息的教师跟踪器,在约 140 小时的大规模非结构化动作语料上用 PPO 学会跟踪全身运动;再在线蒸馏成一个确定性的编码器-解码器,关键约束是把潜在向量压到单位球面(16 维,经 L2 归一化)。球面化消掉了行为克隆里潜在向量范数漂移的失败模式,也让余弦平滑性正则项在几何上有定义。
第二步冻结解码器,训一个基于 Transformer 的关键点编码器。它对每个关键点做一个 token,用带掩码的自注意力(masked self-attention),所以部署时给哪些关键点、不给哪些,都能照常编码,缺失的关键点用 NaN 和 key-padding mask 屏蔽。训练用三阶段掩码课程:先全可见,再逐步退火到部分可见,最后混入「VR 模式」「只看躯干」「单手腕」「双脚踝」等八种语义模式,让编码器对任意子集都鲁棒。编码器输出通过对齐到第一步教师的潜在空间来学。
第三步把冻结的解码器当作「运动先验」(motor prior),用 PPO 在潜在空间里做残差强化学习:一个极浅的 Transformer(1 层)输出对潜在向量的修正量,初始化时增益压到 0.01,保证起步时修正量近似为零、不破坏先验。这样能把控制器扩展到原始动作跟踪覆盖不到的任务。
跟踪性能在不同关键点配置下都很稳:
| 关键点配置 | 点数 | 跟踪成功率 | POI 位置误差 |
| 全身(KP5) | 5 | 97.6% | 10.90 cm |
| 仅上半身 | 3 | 94.8% | 9.48 cm |
| 仅双手腕 | 2 | 94.3% | 10.41 cm |
| 单手腕 | 1 | 93.7% | 10.79 cm |
| 仅躯干 | 1 | 94.3% | 8.34 cm |
| 仅双脚踝 | 2 | 95.4% | 13.39 cm |
作为参照,带特权信息的关节空间命令跟踪成功率是 99.3%。哪怕只给一个关键点,跟踪成功率仍有 93-94%,已经接近满血的关节空间命令跟踪。
下游任务经过潜在空间 PPO 微调后,成功率全部推到 95% 以上:
| 任务 | 不微调 | 微调后 |
| 障碍物抓取-开放 | 54.68% | 97.09% |
| 障碍物抓取-栏杆 | 10.49% | 96.04% |
| 障碍物抓取-低净空 | 44.36% | 99.47% |
| 障碍物抓取-容器内 | 3.04% | 95.56% |
| 空中写字 | 0.00% | 97.87% |
「容器内」和「空中写字」不微调几乎做不了(3% 和 0%),说明潜在空间 RL 确实在补先验覆盖不到的行为。实机上用 Apple Vision Pro 做 VR 遥操作,只用一个或两个手腕关键点就能驱动 Unitree G1,也演示了躯干引导的 3 米直行。
对做人形遥操作和数据采集的人来说,直接价值是不再需要全身动捕服和重定向管线。戴个 VR 头显、给几个关键点,就能驱动机器人全身,大幅降低数据采集门槛。对做策略学习的人,这个冻结的球面潜在空间是个可复用的运动先验:新任务只需要在潜在空间里学一个浅层残差,不用从头训全身控制。把接口从「固定全身命令」换成「任意稀疏关键点」,也让同一套控制器能适应从单手腕写字到躯干引导行走的不同部署场景。
作者自己承认三点:训练语料刻意去掉了爬行、跳跃等极限运动,对语料里罕见的分布外动作控制器会失稳;当前平台没有灵巧手控制,做不了精细抓握交互;对完全没见过的轨迹策略会失败。所有结果都在仿真和单一 G1 平台上,跨硬件的泛化没有验证。空中写字这类任务的成功判定(轨迹全程 5 cm 内)也偏宽松,落到真实抓握精度上还要打折。