大阪大学让 G1 坐万向椅全向走,跟踪误差低于站立策略

Stay Seated: Learning Omnidirectional Humanoid Locomotion on a Passive Mobile Chair with Casters

Kango Yanagida, Kazuki Miyazawa, Takato Horii

cs.RO

2026-08-28

大阪大学把站立速度跟踪环境扩成坐姿任务,用 PPO 让 Unitree G1 蹬被动万向椅全向走。最佳 SY+CC 的 vx/vy RMSE 为 0.151/0.127 m/s,低于站立基线,并零样本上了真机。

这篇在解决什么

人形机器人用准直驱电机站着,关节要持续出力撑住体重,待机电流和发热都下不来。人做桌面工作时会坐下,把体重交给椅子。带万向轮的办公椅还能让人挪位置、换视角,不必站起来。

大阪大学把这件事拆成「坐姿 loco-manipulation」的第一步:先不管伸手去抓,只学坐着全向走。任务很具体。29 自由度 Unitree G1 坐在一把五轮被动万向椅上,骨盆和椅面没有固定连接,要用脚间歇蹬地,把「机器人加椅子」这套耦合系统推到目标速度 vx、vy 和偏航角速度 ωz。

已有工作让人形踩轮滑、滑板、滑雪板、滑板车,多数把身体和器械预先锁死,地面力走器械。坐姿移动要同时维持未固定的骨盆-椅面接触、用脚直接蹬地、还要跟全向速度指令。人和椅子的运动加两处接触很难同步采集再重定向,所以这篇不用动作模仿,只在标准站立速度跟踪环境上做最小改动。

方法

仿真在 mjlab 里,从站立速度跟踪环境起步,加了四样东西:被动椅子模型、描述坐姿的奖励、只给 critic 的椅子特权观测、以及骨盆-椅面接触设置。指令范围 vx、vy 在 ±1.0 m/s,ωz 在 ±0.5 rad/s。每局 20 秒、1000 步;躯干或椅子相对重力倾斜超过 70°,或骨盆离开椅面连续超过 1 秒,提前结束。

接触建模是坐姿任务能训起来的关键。骨盆碰撞网格按视觉网格细化,接触求解的摩擦锥从金字塔锥改成椭圆锥,再把 impratio 提到 10。粗网格加默认接触设置会出现骨盆过度穿模和横向乱滑。

策略是非对称 actor-critic。actor 观测 96 维,只有本体感觉和速度指令,没有脚-地接触、骨盆-椅面接触,也没有椅子状态;critic 观测 217 维,把仿真器里的椅子位姿、脚轮接触、骨盆接触全塞进去。动作是 29 维归一化关节位置,绕初始坐姿做 PD 跟踪。训练用 PPO,4096 并行环境,1 万次迭代,四个随机种子。域随机化覆盖摩擦系数、质心、编码器偏差和椅子阻尼。

奖励覆盖速度跟踪、坐姿维持和脚部惩罚;椅子速度没有单独奖励,跟着接触走。全因子实验扫三个旋钮:

对照是同一指令范围下的站立策略,actor 同样拿掉躯干线速度。

结果

随机指令评估里,每条策略跑 1000 局 20 秒,指令在 10 秒时重采样。八种坐姿条件超时成功率全部不低于 99.45%,相对椅面位移约 1.5 cm,躯干倾斜 RMS 约 0.045 rad。光看不摔倒不够,原地坐着也能撑满 20 秒,所以跟踪误差才是移动有没有发生的证据。

条件vx RMSE (m/s)vy RMSE (m/s)ωz RMSE (rad/s)超时成功率
Baseline0.1650.1440.15199.45%
SY+CC0.1510.1270.14599.80%
SY+FS+CC0.1520.1290.14499.75%
FS0.1960.1880.14199.53%
Standing0.1550.1490.17599.70%

SY+CC 种子平均平移误差最低、超时成功率最高。它和 SY+FS+CC 在三项跟踪 RMSE 上都低于 Standing。对照环境和奖励不同,数字只能说明坐着也能跟到这个精度,不能说坐姿比站立更强。

FS 单独用会出问题。四个种子里有的在斜前方指令上完全不动,收敛到「坐着不动」的局部最优:脚滑惩罚把推进所需的脚部运动也压掉了。给 FS 配上 SY 或 CC,最差种子的跟踪误差仍低于 FS 最好的种子,不必重调 FS 权重。

方向和速度拆开看,运输成本 CoT 在 1.0 m/s 时排成后退 < 侧移 ≪ 前进。SY+CC 前进 1.0 m/s 的 CoT 是 0.543,侧移 0.273,后退 0.209;前进跟踪 RMSE 也跳到 0.308 m/s,腾空占比 63.3%。后退和侧移是脚掌踩实再伸膝,把人和椅推开;前进是脚跟先着地再屈膝,把自己拉向支撑脚。侧移时对侧腿是主推进腿。

站立步态左右自然对称,因为两腿都要承重。坐姿下椅子已经撑住身体,单腿主导也是合法解。不加 SY 的 CC 条件,前进时左右单脚接触占比是 28.5% 对 23.5%,力是 157 N 对 179 N;加上 SY 之后几乎持平。

真机零样本部署到 Unitree G1,定性上能做出前进、后退、侧移和转向,全程保持坐姿。真机上的跟踪精度和抗扰没有量化。附录里各测了 60 秒静止功耗:站着 111.06 W,坐着 101.25 W,差 9.81 W;按 421.2 Wh 电池外推大约多撑 22 分钟。每姿势只有一次试验,论文自己说这不能当成普遍节能结论。

为什么重要

对做人形控制的人,这篇的可复用部分不是「坐椅子」这个噱头。接触拓扑变了之后,标准速度跟踪环境加椅子模型、坐姿奖励和非对称 critic 就能学出来,actor 上真机时仍然只要本体感觉和速度指令。不需要同步采人和椅子的动作捕捉,也不需要接触传感器。

全因子结果有实际调参含义。脚滑惩罚在站立里常用来压多余滑动,坐姿里同一项会把推进也罚掉,单独开会训出原地坐着的策略。对称正则在站立里经常可有可无,坐姿里它才把左右腿拉齐,否则硬件会长期单侧受载。

1.0 m/s 前进腾空超过 60%,论文把它看成「蹬一下再滑行」的苗头。如果后面真做成 impulse-and-coast,坐姿移动的能耗故事会比现在的 9.81 W 静止差更站得住。

局限与存疑

真机证据是定性的。跟踪 RMSE、超时成功率、CoT 全是仿真数字;真机没报速度跟踪误差,也没报抗扰。零样本能走,和「跟指令跟得怎么样」不是一回事。

节能数字更薄。一次 60 秒、只看电池侧功率、没有执行器级分解,外推续航建立在恒功率假设上。论文已经把这句话写进讨论,读者不要把多出来的 22 分钟当卖点。

场景也很窄:一把椅子、一种地面、一套指令范围。骨盆-椅面接触一旦在真机上打滑或坐偏,actor 看不到椅子状态,只能靠本体感觉硬撑。未来要接桌上伸手和抓取,接触拓扑会再变一档,现在这套奖励能不能直接扛过去,论文没有验证。

前进 1.0 m/s 误差 0.308 m/s,相对 1 m/s 指令已经漏掉三成,同时还靠近摩擦极限。全向「都能走」成立,高速前进这一档还没走稳。

术语

原文与代码

社区讨论

相关论文

全部论文解读