用强化学习教神经网络打格斗游戏:agent 极易奖励作弊
microscope1024 · reddit · 2026-09-27
开发者分享了一个实验项目:让两个 agent 用强化学习对战一款类《街霸》格斗游戏,观察能否涌现有趣行为。
- 主要发现是 agent 极擅长 reward hacking(钻奖励漏洞),单纯训练得不到合理对战术。
- 作者通过少量 reward shaping(奖励塑形)加 league play(联赛制对抗训练)才得到相对有意思的结果。
- 项目附完整文章(博客)与可试玩代码,属于可复现的开源实践。
「研究」频道最新
- 一文梳理强化学习自博弈的演化史:从 TD-Gammon 到 AlphaGo — cephaloform · 2026-09-27
- BrushArena 直播 RL 训练全程,绘画模型实时进化可围观 — xeophon · 2026-09-27
- Rethink Priorities 发布数字意识模型:2024 LLM 无意识证据不决定性 — burny_tech · 2026-09-27
- 小米开源 RL 环境仓库,单任务市价数百至上千美元 — burny_tech · 2026-09-27
- 从噪声高维观测恢复系统方程,DYSCO 论文入选 NeurIPS — burny_tech · 2026-09-27
- Solomonoff 归纳像智能的真实运作,但物理上无法实现 — burny_tech · 2026-09-27