HG-DAgger 用错反而更差:退火阶段只用干净演示,成功率拉到 88%
DominiqueCAPaul · x · 2026-09-30
机器人学习实践者 @aurelarnold 分享了一个 HG-DAgger(人工干预式模仿学习)训练中的踩坑与修复经验。
问题:第二轮干预数据收集后,策略 π2 的成功率几乎没有提升,平均回合时长反而明显变长。原因是干预质量差——策略陷入糟糕状态时,人类干预者的动作比正常演示更慢、更不流畅(不在状态流里),大量这类干预数据教会策略「动作变慢、更依赖恢复」。
修复方法:在训练退火(annealing)阶段只用干净演示收尾。这样既保留了从干预状态中恢复的技能,又恢复了演示中快速、精准的运动风格。
结果:在「full box」任务上成功率提升到 88%。对做遥操作/干预数据采集的机器人训练团队有直接参考价值。
「具身」频道最新
- 投资人:20 亿美元入场 Figure,看的是万亿美元级结局 — markjeffrey · 2026-09-30
- Dyna Robotics 推 Dyna-2.1:机器人从单任务升级为「整员工」按角色收费 — JasonMa2020 · 2026-09-30
- Wayve 旧金山及高速路段载客实测:全程零接管 — alexgkendall · 2026-09-30
- 树莓派30美元智能显示模块开售,可加装Hailo实现AI加速 — JeremyCMorgan · 2026-09-30
- Dyna Robotics:仅 30 分钟机载数据,机器人 Taku 学会全新全身任务 — charlieholtz · 2026-09-30
- YC 转发「智能体制造」基础设施:说出想法,机器人零件送上门 — ycombinator · 2026-09-30