机器人研究者拟用 DSRL 在潜空间强化学习改进 BC 扩散策略
DominiqueCAPaul · x · 2026-09-03
研究者 jannesdge 表示准备尝试 DSRL(Diffusion Steering via Reinforcement Learning)来改进其行为克隆(BC)策略。该方法出自 Sergey Levine 等人的论文《Steering Your Diffusion Policy with Latent Space Reinforcement Learning》:在扩散策略的潜噪声空间上跑 RL,从而对 BC 策略做样本高效的自主在线改进,只需黑盒访问策略,避免昂贵的补充人类演示。前提是策略需「可被导向」——即不同噪声初始化能产生明显不同的轨迹,他快速测试后确认这一点成立。
「具身」频道最新
- Agility Digit 展示 RL 遥操作策略,整理一整屋大小各异的物品 — chris_j_paxton · 2026-09-03
- Physical AI 双支柱:RealSense 管 3D 感知,QNX 做安全认证的实时控制层 — pdamodaran · 2026-09-03
- Heart Aerospace 电动飞机只花 5 美元电费完成飞行演示 — markjeffrey · 2026-09-03
- Uber 裁员 3300 人占员工 10%,削减管理层加码 Robotaxi 投入 — saibharadwaj · 2026-09-03
- Greg Madison 数字孪生住宅 demo 被赞近年最酷体验 — Scobleizer · 2026-09-03
- 西方压价东方?HT Robotics 人形机器人约 5000 美元遭遇 399 美元竞品 — philfung · 2026-09-03