Workhorse: Learning Robust Whole-Body Humanoid Loco-Manipulation from Human Data
Songbo Hu, Qiayuan Liao, Yufeng Chi, Kevin Zakka, Yakun Sophia Shao, Pieter Abbeel, Koushil Sreenath
cs.RO, cs.LG
2026-10-07
穿戴设备采人类演示,免重定向训练规划器与跟踪器,真机 G1 踢箱、接抛物、攀爬行李箱,仿真分拣成功率 77%、受推仍有 64%。
人形机器人已经能很好地跟踪一段给定的全身参考动作,BeyondMimic、GMT 这类 motion tracker 干的就是这件事。但操作任务没有现成轨迹:机器人只凭第一视角 RGB 和本体感知,得自己规划蹲下、伸手、用腿抵住物体的全身动作,还要扛住场景变化和外来推搡。
数据是另一半问题。遥操作要占用机器人和熟练操作员;免机器人的穿戴方案(HuMI 等)便宜得多,但已发表的任务里脚基本只用来走路,动作也多为准静态。这篇把脚变成操作工具:踢箱子进货架、用腿抵着行李箱把它放倒、踩上箱面去够高处。
系统分两个策略,靠同一个接口通信:五段连杆的位姿,也就是躯干、两个手腕、两只脚。
采集设备很轻:五个 HTC Vive tracker 绑在胸挂相机支架、两手背、两鞋面,四个 Lighthouse 基站在 5 m×5 m 区域内以 60 Hz 定位到同一个重力对齐坐标系;胸前的 DJI Osmo Action 4 录 129° 近鱼眼视频。同一型号相机装上机器人,训练与部署的畸变、卷帘快门完全一致。录制只扰动物体、从不推人,每条记录都是意图动作;开场三次拍手对齐两路时钟,残差 5.5 ms。全部数据来自一名演示者:分拣 2.2 小时、行李箱 1.2 小时、接箱 13 分钟。
接口里没有关节角。五连杆位姿是任务空间量,记录下来的人体运动本身就是两个策略共同的训练目标:没有 retargeting、从不缩放,机器人必须够到人够到的确切位姿。整套接口只有五个「安装位」与机器人相关,即把对齐坐标系固定到机器人连杆上的常量变换;换一个人形机器人,量这五个常数、换仿真模型、用同一批演示重训即可。
视觉规划器读 4 帧图像和 9 个五连杆历史样本,输出 58 步、跨 1.16 s 的动作块;flow-matching 策略配 DiT 骨干,ResNet-18 编码图像,10 步 Euler 推理,5 Hz 重规划。全身跟踪器是基于 BeyondMimic 的 RL 策略,50 Hz 输出关节设定值,只看本体感知。奖励里手腕在世界系考核,必须到位;脚在躯干系考核,允许自由换落脚点保平衡。
两个策略分开训练,部署时却要闭环配合,所以各自的数据增强都在预演对方的错误。规划器的训练图像先离线处理:SAM 3 抠掉人、LaMa 补全背景、MoGe-2 估度量深度,再把 IK 摆好的机器人渲染进画面;训练时还给五连杆历史加随机游走漂移,图像按相机运动一致扭曲。跟踪器则对着会漂移、会跳变的命令训练:重规划间隔随机取 0.2 到 1 s,两次重规划之间漂移最多涨到 10 cm 平移加 10° 航向,奖励按漂移后的命令计算。部署用时间戳对齐两套延迟,相邻动作块的重叠段在 flow 积分中 inpaint 进新块。
真机 Unitree G1 上,跟踪器板载运行、规划器跑外接笔记本,不依赖外部动捕。机器人双手把两个箱子放上货架摆正,第三个直接踢进底层;接住抛来的箱子,飞行约 0.56 s;把 14 kg 拉杆箱推到架边,用腿抵住底座放倒,踏上 0.39 m 高的箱面取箱再跳下。真人中途推、踢、抽走箱子,机器人保持站立并继续任务。
成功率只在仿真里报:把演示房间扫成 Gaussian splat 重建,在 mjlab 里每个设置跑 100 回合,推动是每 5 到 10 s 一次 40 N·s 的随机方向冲量。
| 变体 | 无推动成功率 | 受推成功率 |
| 完整系统 | 77% | 64% |
| 关节命令(在线 IK) | 54% | 42% |
| 连杆局部动作坐标系 | 5% | 4% |
| 去掉规划器数据增强 | 20% | 0% |
| 去掉命令漂移增强 | 76% | 52% |
几个读数:换成在线 IK 解关节命令(BifrostUMI 的做法)后成功率掉 23 个点,但受推摔倒率反而从 15% 降到 4%,关节命令总是可达,机器人摔得少、任务丢得多。去掉历史里的 projected gravity 后成功率只剩 1%,几乎每回合都摔。命令漂移增强在无推动时几乎无差(76% 对 77%),价值集中在受推场景(52% 对 64%)。同一批演示重训全身尺寸更接近真人的 Unitree H2,无推动成功率 83%,与 G1 的 77% 之差小于 ±11 个点的 95% 置信区间。
用免机器人的人类数据教出「脚参与操作」的动态行为,采集成本比遥操作低一个量级;五连杆接口加固定安装位,把跨本体迁移变成量五个常数再重训,H2 实验给了初步证据。「每个策略用数据增强预演对方的部署错误」这个配方也不限于人形,任何规划器加跟踪器的分层系统都能照搬。
位置也要摆正:这是三个任务各自的专用策略,不是通用操作模型;真机部分是能力演示,所有成功率数字来自单一房间的仿真重建。
作者自述:每个任务各有独立的 planner 和 tracker;单人单房间,全部测试都在该房间或其重建里;真机实验只展示能力;H2 结果只在仿真中,真机是下一步;五连杆不含手指和头部,表达不了抓握手型,相机固定在躯干上不能主动环顾;Lighthouse 基站把采集锁在一个房间。
读下来再补几点。仿真评测里外观、光照、摩擦、质量固定,回合间只换箱位和初始位姿,跨环境泛化没有验证;为弥合外观差距,约 15% 的规划器训练数据采集自重建房间,说明仿真与真机图像仍有距离;受推 15% 的摔倒率离实用还远;踢箱、抵箱的接触动力学依赖仿真里的物体建模,论文没有单独评估这部分保真度。