北大 DexPolicy:探索噪声退火让灵巧手操作成功率升至 85%
PekingUniversity · hf · 2026-10-02
北京大学发布 DexPolicy,针对灵巧手操作 RL 中“探索噪声有助于发现接触、却妨碍精准控制”的矛盾,把探索尺度显式设为训练步数的函数,从宽到窄退火,其余损失、架构、奖励与优化器设置不变。
- 在 ViViDex 轨迹引导设定下,基线 PPO 在 5M 步后仍维持初始动作噪声,因此需要显式控制探索规模;
- 对比 PPO、无 critic 的 GRPO 延续训练与流参数化 PPO 变体(FPO)三种策略优化设置:五个 YCB 物体上平均确定性 Target 成功率分别从 32.0%→35.7%、14.1%→45.4%、49.4%→68.1%;
- 真机 RealMan RM75 + Inspire/RH56 灵巧手上,360 次试验中 FPO 将平均成功率从 25.0% 提到 85.0%,GRPO 到 63.3%,PPO 到 43.3%;
- 发现训练回报、确定性成功率与对执行噪声的容忍度相互解耦,调度应按目标执行条件下的最终任务成功率评估。代码与项目页已开源。
「具身」频道最新
- YC F26 项目 Preload:给机器人数据加上「触觉神经」 — ycombinator · 2026-10-02
- 控制学者反驳:域随机化牺牲精度,RL 并非万能解 — KyleMorgenstein · 2026-10-02
- 高通发布 IVD 基准:VLM 实时回答现实场景问答远落后人类 — rishit_dagli · 2026-10-02
- 机器人行业金句:没有专人设计维护的机器人只是库存 — MatthewChang · 2026-10-02
- 银河星仔 ET1 售价曝光:7.9 万元起,能斗舞还能边看边学动作 — 量子位 · 2026-10-02
- 机器人论文日增 210 篇,四年前每天仅 20-30 篇 — DJiafei · 2026-10-02