机器人研究者拟用 DSRL 在潜空间强化学习改进 BC 扩散策略

DominiqueCAPaul · x · 2026-09-03

研究者 jannesdge 表示准备尝试 DSRL(Diffusion Steering via Reinforcement Learning)来改进其行为克隆(BC)策略。该方法出自 Sergey Levine 等人的论文《Steering Your Diffusion Policy with Latent Space Reinforcement Learning》:在扩散策略的潜噪声空间上跑 RL,从而对 BC 策略做样本高效的自主在线改进,只需黑盒访问策略,避免昂贵的补充人类演示。前提是策略需「可被导向」——即不同噪声初始化能产生明显不同的轨迹,他快速测试后确认这一点成立。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →