Digimon AI 项目:PPO 训练中的奖励黑客问题与进展

redfoxkiller · reddit · 2026-09-02

作者分享了其 Digimon AI 项目(Digi-Brain)的最新进展。该项目使用 PPO 算法训练智能体在随机生成的地下城中探索。主要挑战在于 PPO 更新时会出现数值尖峰,导致智能体(Yozoramon)陷入局部最优(如沉迷于一楼蛋糕)而停止深入。新版本改进了早期学习阶段,虽然仍有部分运行终止于一楼,但到达二层后,深入三四层的稳定性已显著提升。作者目标是实现稳定学习,避免数月的训练周期,并计划随后转向 Neural-MMO。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →