步态训练技巧:用滚动平均速度奖励避免振荡

yacineMTB · x · 2026-09-01

开发者在强化学习训练中发现,直接追踪当前步速度的奖励会导致模型出现步态振荡(shuffle)。改为基于更长时间窗口的滚动平均速度计算奖励后,新策略表现显著优于之前的 pollen trainer。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →