A GPU-Parallel Framework for Heterogeneous Multi-Task Reinforcement Learning
Rui Zhang, Qiwei Wu, Zhengyu Zhang, Tao Li, Hongyu Zhou, Xiang Li, Yunrong Guo, Junjie Lai, Renjing Xu, Weihua Zhang
cs.RO
2026-06-02
Hebero 把 LIBERO 全部 40 个异构操作收进同一套 GPU 并行仿真,每任务只用 50 条示教,IW-ABC 让单策略状态平均成功率达到 90.1%,比最强基线 FAMO-ABC 高出 7.8 个百分点。
GPU 并行仿真能在一块卡上同时跑几千个机器人环境,吞吐却大多仍喂给「一个任务、一个策略、一次训练」。一个策略要同时学很多结构不同的操作,卡点换成三件:稀疏成功信号下怎么探索,任务进度不齐时更新怎么分,少量示教是用来热启动、做正则,还是直接做成奖励。
RLBench 和 LIBERO 有任务多样性,但物理在 CPU 上。MTBench 主要是状态输入。ManiSkill3 按任务分开训学习器。Hebero(异构机器人学习基准)把 40 个 LIBERO 任务的状态、视觉、示教和评测收进一个 Isaac Lab 进程,联合训练一个策略。
评测也不沿用 LIBERO 的固定起点。可动物体的平面位置在 50 条示教起点的包围盒内重新采样,并做碰撞拒绝。测摆放变化,不是复读那几条轨迹。
基准与算法分开。Hebero 定任务、仿真和评测。DGPO(Demonstration-Guided Policy Optimization,示教引导的策略优化)在上面训:示教同时提供稠密跟踪奖励和特权 critic,骨干是任务条件 PPO,各学习器只改示教怎么用。
40 个任务来自四组套件,Goal、Object、Spatial、Long 各 10 个。场景和成功条件不同,动作、控制和机器人本体相同。任务编码 36 维 multi-hot:6 个共享子任务位,30 个任务 ID 位。动作 7 维,6 维末端相对位姿,1 维夹爪。状态输入另加 26 槽物体–目标位姿,共 300 维;视觉输入改为冻结 ViT 对第三人称和腕部图像的池化特征,共 450 维。Actor 为 [512, 256, 128],状态版约 0.32M 参数。
任务奖励只在成功时发一次奖,并惩罚动作抖动和关节越限。跟踪奖励把末端、关节、夹爪、物体位姿和开合误差做成指数核,机器人怎么动、世界怎么变都给分。Critic 额外看这些误差和示教进度。部署时没有的量只给价值网络,即非对称价值学习(asymmetric value learning)。
IW-ABC 用一个信号管模仿和任务权重。τk 是该任务训练成功率的指数滑动平均,不单独评测。ABC(adaptive behavior cloning,自适应行为克隆)让模仿系数随 τk 上升和训练时间下降:先学会的任务先松开示教;时间退火结束后,难任务也只剩残差下限。目标是示教游标上的动作,监督高斯均值,加进 PPO 损失。
IW(importance weighting,重要性加权)则把 PPO 的策略、价值和熵都偏向落后任务。采集仍按任务均分环境。τk 低于均值时,sigmoid 把权重抬高,范围约 0.5 到 2,一次反传完成,不必分任务求梯度。FAMO-ABC 用损失进度调权,且只调 critic,模仿仍用 ABC,预算相同。对照还有 BC 热启动、DAPG 正则和 RFCL 课程。
一块 L20 上 1600 个环境,仿真约 7500 steps/s,显存 10.6 GiB。同样规模的 96 核 MuJoCo 为 2200 steps/s,内存约 1.5 TiB,吞吐大约是它的 3.4 倍。8 块 L20、25600 环境的端到端训练到 78500 steps/s。单卡增加每任务副本后,同一墙钟预算下平均成功率上升。
全部学习器共用 DGPO:每任务 50 条示教,30000 次 PPO 更新,3 个种子,8 块 L20、每卡 2000 环境,大约两天。
| 方法 | Mean SR | Long SR | 覆盖(≥80%) | SR-AUC |
| PPO | 50.8±3.1% | 10.0% | 20/40 | 45.2% |
| BC→PPO | 47.5±2.6% | 20.0% | 18/40 | 40.8% |
| ABC | 75.5±3.6% | 40.0% | 29/40 | 71.9% |
| FAMO-ABC | 82.3±2.9% | 53.3±5.8% | 30/40 | 75.6% |
| IW-PPO | 44.9±2.5% | 20.0% | 18/40 | 41.3% |
| IW-DAPG | 68.5±3.0% | 30.0% | 27/40 | 62.4% |
| IW-RFCL | 66.4±2.8% | 30.0% | 26/40 | 60.1% |
| IW-ABC | 90.1±3.8% | 70.0±10.0% | 35/40 | 82.1% |
| Vis IW-ABC | 93.5±2.6% | 81.9±11.5% | 38/40 | 83.3% |
Mean SR 为 40 任务平均成功率,Long SR 只统计长时程 10 任务,覆盖是成功率不低于 80% 的任务数,SR-AUC 是这条平均曲线的归一化面积。
状态 IW-ABC 为 90.1%,比 FAMO-ABC 的 82.3% 高 7.8 个百分点,长时程从 53.3% 升到 70.0%。10 个 Long 任务里达到 80% 的,ABC 有 4 个,IW-ABC 有 7 个,视觉版有 9 个。视觉策略含冻结编码器共 5.92M 参数,平均成功率 93.5%,覆盖 38/40。只加权 actor 时,同一配方的平均成功率是 78.2%,长时程 50.0%,覆盖 31/40。
BC 热启动后的 PPO 为 47.5%,低于纯 PPO 的 50.8%。只加 IW 不加 ABC,平均成功率降到 44.9%,长时程却从 10% 升到 20%。两边一起用,平均和长时程才同时上去。带上 IW 之后,ABC 仍高于 DAPG 的 68.5% 和 RFCL 课程的 66.4%。
真机换成 RoboTwin 的四个 Piper 任务,联合训练的状态策略冻结权重部署,位姿由 FoundationPose 从外部提供。每任务 20 次:按铃 20/20,摇瓶 15/20,药瓶上垫 13/20,容器上盘 18/20,合计 82.5%。
这份基准的用处,是异构任务、GPU 并行和多任务评测终于在同一份合同里。示教接口能换,奖励、观测、PPO 和评测协议不动,学习器差异才读得出来。IW-ABC 不重,进度就是训练成功率的滑动平均。0.32M 参数的状态 actor 拿到 90.1%,这 40 个桌面操作里,容量不是第一约束。
提升是渐进的,而且站在跟踪奖励和在线模仿之上。任务重加权单独用,平均成功率不升反降。视觉版 93.5% 使用特权 critic 和冻结编码器。真机 82.5% 只说明四个状态任务、外部位姿能上车。
论文写明两处。按时间去索引示教动作,策略偏离参考后目标会错位,跟踪奖励只能减轻,去不掉。算力把训练和评测限制在 LIBERO 与 RoboTwin,更难、更大的任务集没有做。
评测任务就是训练任务,没有留出集,数字是多任务掌握,不是迁移。FAMO 只改了 critic 的权重,策略损失和熵仍均匀,7.8 个百分点的优势限于这个接法。Long SR 波动大,IW-ABC 为 ±10.0 个百分点,视觉版 ±11.5,3 个种子撑不起稳定排序。真机失败没有拆成策略误差和外部感知误差。单卡扩环境只有趋势,没有逐档成功率。