HG-DAgger 用错反而更差:退火阶段只用干净演示,成功率拉到 88%

DominiqueCAPaul · x · 2026-09-30

机器人学习实践者 @aurelarnold 分享了一个 HG-DAgger(人工干预式模仿学习)训练中的踩坑与修复经验。

问题:第二轮干预数据收集后,策略 π2 的成功率几乎没有提升,平均回合时长反而明显变长。原因是干预质量差——策略陷入糟糕状态时,人类干预者的动作比正常演示更慢、更不流畅(不在状态流里),大量这类干预数据教会策略「动作变慢、更依赖恢复」。

修复方法:在训练退火(annealing)阶段只用干净演示收尾。这样既保留了从干预状态中恢复的技能,又恢复了演示中快速、精准的运动风格。

结果:在「full box」任务上成功率提升到 88%。对做遥操作/干预数据采集的机器人训练团队有直接参考价值。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →