3行代码修复123次失败实验:让PPO学会动态追踪

mikeysce · reddit · 2026-08-04

一位开发者在尝试用 PPO 算法训练 AI 玩 Atari 游戏《打砖块》时发现,模型总是倾向于记忆固定动作序列(脚本化),而非像人类一样动态追踪弹球。

在经历了 123 次失败实验后,作者意识到问题不在于环境工程的复杂化,而在于奖励重塑。仅用三行代码,引入了一个微小的奖励机制:在球下落时,直接根据球拍与球的水平距离给予微小奖励(每帧 0.05 分)。

这种改变将优化压力直接导向“追踪球”,成功打破了模型对脚本动作的依赖。作者还开源了包含所有失败记录的项目,并制作了可视化对比工具。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →