From Pretraining to Proficiency: Real-World Subtask RL for Long-Horizon Manipulation with Minimal Human Intervention
Sichang Su, Benjamin Yang, Zhiyun Deng, Boyuan Liang, Yip Fun Yeung, Zelin Wang, Lingfeng Sun
cs.RO, cs.LG
2026-09-18
PARTS冻结π0.5基座,只在卡点子任务上训有界残差,双臂YAM全任务成功率从32%升到61%,单臂Franka从50%升到95%,平均每任务实机滚动约几十分钟。
预训练的 VLA 往往能把长程操作走完大半截,却在少数卡点反复失败:毫米级的耳机入盒、线缆对孔,或尺寸超出示范分布的乐高抓取。再采一整条任务的示范做 SFT,等于让操作员把已经会的前置动作再做一遍。整段任务上做 RL 也不顺:奖励要等 20–120 秒后的最终成败,前面的子任务成功了、后面失败,中间那段仍然是零;早期失败还会让后面的子任务根本练不到。
需要一种把练习集中在卡点、滚动过程少人盯着的办法,并且最终仍按完整任务成功率验收。
PARTS(Policy Adaptation with RL on Targeted Subtasks)把基座冻住,只在人标出来的卡点上加残差。
流程是:先用任务示范对 π0.5 做 SFT,得到 π0,在实机上找出反复失败的子任务。人给每个卡点写一份合同:入口状态、可改的动作维和物理边界、成功判据、运动预算,外加少量子任务示范。编码代理(Claude Fable 5 与 GPT-6 Astra)据此写出三个可执行程序:
感知用 SAM3 出物体掩膜,Gemini-3.7-flash 异步回答物体状态。残差是轻量 actor-critic,吃基座的视觉特征、本体感觉和名义动作块,输出有界修正,掩码限制在相关维度(夹爪开合、末端平移)。学习用块级 TD3+BC:成功段克隆执行过的残差,失败段把残差往零拉,避免学飞。对名义动作块做 reference dropout,防止残差只会抄基座。
在线更新在成功率低时信号很稀,而且为了省复位,尝试常被重摆到子任务起点,分布比评估时更窄。于是周期性做成功重加权再训练:保留全部成功回合,失败只抽比例 ρ,用新网络在这份数据上重训,再部署回去继续在线收数。评估时残差在入口接棒、出口交还基座。
人在滚动中的角色被压到最低。DSRL 滚动自主,但奖励和复位要人;EXPO-FT 和 RLT 每个回合都有人接手或干预。PARTS 的滚动不需要人改动作或切策略;乐高和插线的奖励与复位可全自动,耳机入盒仍要人核对校验器,场景掉到地上也要人捡。
三个长程任务,每方法 20 条完整回合,滚动时间对齐。双臂 YAM:打开充电盒、稳住、插入两只耳机再盖上;以及 150 秒内把十块小乐高分进三个颜色盒。单臂 Franka FR3:从源路由器拔线再插入目标口。卡点子任务一般 3–15 秒。
| 任务 | 基座(SFT) | PARTS | 滚动时间 |
| YAM 全任务成功 | 32% | 61% | 约几十分钟/任务 |
| Franka 全任务成功 | 50% | 95% | 插线 29 分钟 |
| 乐高进度(十块里完成的比例) | 54% | 82% | 17 分钟 |
耳机任务全任务成功率约四倍于基座,两次插入各提高 20–35 个百分点。插线因为拔线基座已经会,练习全砸在插入上,插入成功近翻倍。对照在同一滚动预算下做全任务 RL:DSRL 在冻结 VLA 的噪声潜空间里搜,EXPO-FT 还更新骨干,RLT 在人指定的切换点后由单个 RL 策略接管到结束。PARTS 的全任务成功比这些方法高出 25 个百分点以上。EXPO-FT 甚至低于基座,偶尔把已经会的拔线弄坏。去掉成功重加权再训练,耳机的子任务和全任务成功都下降。
这是给「基座大体能做、卡在几步精密操作」的实机设定准备的修补术,不是从零训技能。冻结 VLA、局部奖励、残差只动几维,把信用分配从整分钟缩到十几秒,还避免稀疏全任务奖励把已经稳的前置动作冲掉。
代价是人要在开局标卡点、写合同;编码代理写的选择器和校验器还要人审。耳机这种「插入去和搁在盒沿上看着像」的任务,校验器仍要人盯。想把它当成无人值守的整夜 RL,现在还早。
评估每任务 20 条,长程二值成功的置信区间很宽,32%→61% 这种摘要数字应当当成量级而不是精确排名。基座只试了 π0.5。乐高的「失败」很大程度是夹爪闭合量不够,残差几乎是在修一个一维偏差,推广到接触动力学更乱的装配要另说。
人没有从滚动里消失:卡点发现、合同、程序审核、部分复位和耳机标签仍在。未来工作自己也写了,希望代理从失败里自动找卡点、生成稠密奖励和恢复阶段。成功重加权再训练还要人挑 checkpoint。编码代理用的是特定模型快照,换一代模型,选择器和校验器会不会写飞,论文没有测。