北大 DexPolicy:探索噪声退火让灵巧手操作成功率升至 85%

PekingUniversity · hf · 2026-10-02

北京大学发布 DexPolicy,针对灵巧手操作 RL 中“探索噪声有助于发现接触、却妨碍精准控制”的矛盾,把探索尺度显式设为训练步数的函数,从宽到窄退火,其余损失、架构、奖励与优化器设置不变。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →