PARTS 框架:子任务级 RL 微调,双臂任务成功率 32%→61%
Sichang Su · hf · 2026-09-22
- 问题:预训练机器人策略能完成长程任务的大部分,却总在少数关键子任务上失败;补全任务演示做 SFT 成本高,纯稀疏奖励的 RL 微调难以解决长程任务。
- 方法:提出 PARTS(Policy Adaptation with RL on Targeted Subtasks),把训练集中在瓶颈子任务:冻结的预训练策略提供常规动作,agent 生成的选择器与成功验证器激活残差修正并给出局部奖励;在线 RL 结合按成功率加权的重训练,逐轮重部署采集经验。人类仅在初始化时标记瓶颈、必要时物理复位。
- 结果:在双臂 YAM 与单臂 Franka 任务上,完整任务成功率分别从 32%→61%、50%→95%;同等真实 rollout 预算下比现有方法高 25 个百分点以上,人工参与更少。
「具身」频道最新
- 约翰霍普金斯将在 IROS 2026 办可扩展触觉灵巧操作工作坊 — _krishna_murthy · 2026-09-22
- KAIST 提出无结构单目 VIO 初始化法 SLIM-init,入选 IROS 2026 — zhenjun_zhao · 2026-09-22
- LoG-VGGT:跨窗口注意力让长序列 3D 重建内存可控 — zhenjun_zhao · 2026-09-22
- VoxelTTO:体素对齐前馈 3DGS 加测试时优化,仅 80 GPU 时训练 — zhenjun_zhao · 2026-09-22
- Info3R:信息自适应测试时训练,KITTI 位姿误差降至 1.68 倍 — zhenjun_zhao · 2026-09-22
- SFVO:置信度引导的双目-光流视觉里程计,免训练直出 6-DoF 位姿 — zhenjun_zhao · 2026-09-22