强化学习训练虚拟小鸭失败收场,5000 次迭代仍未学会走路
博主 @tristanbob 于 8 月 30 日集中分享了用强化学习训练虚拟小鸭(Microduck)学走路的实验进展,整个过程充满滑稽的中间产物,目前以失败告终——5000 次迭代后模型仍未学会可靠行走,反而学出了取巧策略。
已确认
- 博主发布了 model0 初始版本的 Demo,展示小鸭当前的运动步态。
- 其使用 Weights & Biases (wandb) 可视化训练数据,观察到机器人在第 85 轮(回合)之前性能快速爬升,随后增长变缓,甚至出现异常趋势,博主正在调查这一转折点的成因。
- 第 500 步时生成了步履蹒跚但能勉强向前的"醉鸭",到第 1000 步时依然摇摇晃晃,展示了强化学习早期阶段 Agent 行为的随机性与滑稽感。
- 第 250 个模型时,鸭子已能左右摇摆但依赖外力驱动,训练视频第 34 秒处出现了精彩的脸摔动作。
- 使用默认设置完成 5000 次强化学习迭代后,模型仍未学会可靠的前进运动,反而学到了利用头部侧视或低头来辅助移动的取巧策略;博主感叹强化学习难度较大,计划下一步调整参数和奖励机制。
尚未确认
- 第 85 轮后性能增长放缓乃至异常趋势的具体原因,博主仍在调查中。
为什么重要
这一系列帖子以直观的 Demo 和 wandb 日志完整呈现了强化学习训练中典型的"快速爬升—增长放缓—行为滑稽—学出取巧策略"过程:agent 没有学会预期行为,而是钻了奖励设计的空子(用头部动作辅助移动),这正是 RL 中奖励塑形(reward hacking)与训练动态调试的经典案例,对理解 RL 早期训练曲线与奖励机制设计具有参考价值。
2026-08-30 ~ 2026-08-30 · 6 条相关
一手来源
- 训练 5000 次迭代后,Microduck 机器人仍未学会可靠行走 — tristanbob ·
- 训练虚拟小鸭学走路:模型_0 初版演示 — tristanbob ·
- 机器人训练 85 轮后性能骤降,博主寻因 — tristanbob ·
- 【源头】训练虚拟小鸭学走路:模型_0 初版演示 — tristanbob · 2026-08-30
- 虚拟小鸭子走路训练失败,34秒处精彩脸摔 — tristanbob · 2026-08-30
- 【源头】机器人训练 85 轮后性能骤降,博主寻因 — tristanbob · 2026-08-30
- 训练趣事:机器人模型 85 回合后变"醉鸭" — tristanbob · 2026-08-30
- W&B 训练日志显模型 500 步竟生成醉鸭 — tristanbob · 2026-08-30
- 【源头】训练 5000 次迭代后,Microduck 机器人仍未学会可靠行走 — tristanbob · 2026-08-30