DADP 让同一扩散策略跨越不同机器人动力学
新智元 · wechat · 2026-07-27
UC Berkeley、北京大学、CMU 和清华大学联合提出 DADP(Domain-Adaptive Diffusion Policy):它不是针对每个动力学条件单独训练一个机器人策略,而是训练一个能感知当前域、并在生成动作时主动利用域信息的统一策略。
- 论文针对的是机器人控制里常见的“换环境就失灵”问题:策略往往只适应训练时的摩擦、质量、阻尼和身体比例,一旦部署环境变化就失效。
- DADP 先用 lagged-context 预测把上下文和当前时刻拉开,尽量过滤掉速度、步态相位等瞬时线索,提取更稳定的域表征;再把这个表征写进扩散过程,让动作生成从“域感知”的先验出发,而不是统一的高斯噪声。
- 在 MuJoCo 和 Adroit 的零样本跨域任务里,论文报告了较强表现,尤其在 OOD 场景下优势更明显;其中 Walker2d 是亮点案例。
- 消融显示:上下文离当前时刻越远,表征越干净;而“域先验 + 修改后的扩散目标”比单纯把表征拼到输入里更有效。
「具身」频道最新
- Astribot 的 Lumo-2 用世界动态潜空间提升长时序机器人任务 — jiqizhixin · 2026-07-27
- SynapseSemi 把神经网络塞进了相机像素里 — ycombinator · 2026-07-27
- Enigma 融资 7000 万美元,要把机器人控制变简单 — luisdans · 2026-07-27
- IROS 2026 将在匹兹堡办灵巧触觉感知工作坊 — mangahomanga · 2026-07-27
- AGIBOT 联合京东物流发布 50 公斤重载人形机器人 — CyberRobooo · 2026-07-27
- U-BOT 进入早期草图阶段,定位户外工具机器人 — _Stocko_ · 2026-07-27