边走边抓不再停:CoorDex 拆开身体和手先验,让 49 自由度人形灵巧操作

CoorDex: Coordinating Body and Hand Priors for Continuous Dexterous Humanoid Loco-Manipulation

Sikai Li, Shuning Li, Zhenyu Wei, Yunchao Yao, Chenran Li, Mingyu Ding

cs.RO, cs.AI, cs.LG

2026-06-23

CoorDex 拆开身体和灵巧手两个先验,让 49 自由度人形边走边抓;WalkGrab 成功率 0.55,关节空间 PPO 为 0。

这篇在解决什么

人形机器人「边走边抓」做不好。现有的人形 loco-manipulation(移动操作)基本是个停停走走的过程:走到物体前、停下、操作、再走;而且大多配的是低自由度的夹爪,只会开合两种状态。换成 20 自由度的灵巧手,要在行走中稳定抓握,难点在于手腕位置是由脚步时序、躯干姿态、整体前倾一起决定的,如果让「手」的模型同时去解释这个 6 维手腕位姿,它的容量大部分都花在摆放手腕上,而不是花在协调五根手指上。CoorDex 想让高自由度灵巧手在移动中完成连续操作。

方法

把高维的身体和手控制,转换成「协调的潜在残差控制」,分两块搭。

先建两个分开的先验。身体先验针对 G1 的 29 个身体关节,用一个 16 维潜在空间;手先验针对 WUJI 五指手的 20 个手指关节,用 12 维潜在空间。两者都先训带特权信息的教师跟踪器,再蒸馏成本体感知条件的先验和冻结解码器。手先验的关键设计是「手腕稳定」(wrist-stabilized):训练时把参考手腕位姿直接写进仿真,教师只控制手指运动,这样手的潜在空间不必解释手腕位姿,学到的潜在命令直接服务于手指协调。

然后是协调的潜在残差策略。每一步,两个冻结先验先用各自的本体感知算出潜在均值,作为默认动作;一个共享的协调主干融合身体状态、手状态、任务上下文、手-物状态和上一拍残差,产出任务级特征;再由两个分开的残差头分别预测身体残差和手残差,加到各自先验均值上,送进冻结解码器得到关节目标。身体残差调迈步、躯干、伸手、手腕摆放,手残差调手指预形、闭合、接触。这种「共享上下文加分开头」的设计,让两个子系统通过任务状态耦合,又不至于塌成单一的动作头。

探索发生在 28 维潜在空间(16 身体加 12 手)里,不在 49 维关节空间里,这是能把这种接触密集任务训出来的关键。长程任务还用了无示范的参考状态初始化(NoDemoRSI),用策略自己访问过的状态当重置分布来引导探索。

结果

平台是装了 20 自由度 WUJI 五指手的 Unitree G1,在 Isaac Lab 里评估 5 万个 episode。

任务成功率备注
WalkGrab(走-抓-提)0.55接近瓶子时速度约 0.25 m/s,不停下
OpenFridge(行走中开冰箱)0.66门开到 57.76/60°
WalkPickTurn(走-拾-转)0.89最小航向误差 9.98°

消融在 WalkGrab 上做,关键对照(同样 PPO 预算):

方法成功率抓取率是否停下
全关节空间 PPO0.000.00停(把身体扭成怪姿态避免摔倒)
身体先验加手关节空间0.000.01停(退化成静止抓取)
单一潜在头(monolithic)0.00无可靠抓取动作抖、动作率 0.40
CoorDex0.550.55不停

三组对照全部失败,CoorDex 是唯一不停下、还能可靠抓起来的。单一潜在头虽然能到交互区域,但身体动作不自然、更抖(动作率 0.40 对 CoorDex 的 0.22),抓握完全不可靠。

为什么重要

对做人形操作的人来说,这条路线证明了「边走边抓」在高自由度灵巧手上是可训练的,不必退化成停停走走或开合夹爪。把身体和手拆成两个先验再协调,而不是塞进一个高维动作头,是让 49 自由度接触密集任务训得动的结构性原因。同一个身体先验也可以被不同任务复用,换手或换任务时主要重训残差策略。但目前距离真机还有感知这一大关。

局限与存疑

作者承认三点:策略用的是特权状态观测(物体位姿、接触信号),还没碰感知和视觉 sim-to-real;实验只在一个固定的 G1 加 WUJI 手上做,更多物体、更多硬件没验证;长程任务仍依赖 NoDemoRSI 这类任务特定的探索辅助。另外 WalkGrab 0.55 的成功率是在仿真里、且评估给的是仿真特权观测,真机抓握可靠性大概率要再降。整套结果目前是仿真能力证明,不是部署就绪。

术语

原文与代码

社区讨论

相关论文

全部论文解读