14 岁作者用强化学习训练 AI 玩 PolyTrack 赛车,揭示极端闭环敏感性
michael201110 · reddit · 2026-10-06
一位 14 岁作者分享了其强化学习项目 PolyBot:训练 AI 在赛车游戏 PolyTrack 中驾驶。项目先后尝试 TQC、PPO 和 GRTQC 等方法。
关键发现
- 车速提高后系统极其敏感:对已训练好的 TQC 策略(单圈 24.263 秒)只加 +0.0001 的持续转向偏移,车辆就会在约 56% 的赛道上失败;纵向输入 ±0.0001 的扰动也能在 24% 进度前导致失败,呈现「赛车版蝴蝶效应」。
- 为此作者摸索了行为克隆/师生迁移、reward shaping、课程学习、确定性评估、quantile critic 等一系列手段。
工程实现
- 通过 PolyModLoader 桥接直接驱动游戏,以固定物理步进推进而非依赖渲染时间,保证训练与评估的确定性。
- GRTQC 从零训练版使用两个 128 单元门控网络、双 quantile critic、121 维输入及自己的课程。
项目附视频演示与开源代码(GitHub: michael201110/poly-bot),作者征求连续控制 RL 方面的反馈,尤其是闭环敏感性问题;下一步计划把数百次历史训练以游戏内幽灵车形式可视化。
「Fun」频道最新
- 两个 AI 实时不暂停对打星际争霸,DeepMind 研究员围观叫好 — OriolVinyalsML · 2026-10-06
- AI 助手 Dot 突然飙西班牙语,疑似说了句不太客气的话 — alexcovo_eth · 2026-10-06
- AI 学术圈名场面:老教授们抢着说「这我 20 年前就做过了」 — rsalakhu · 2026-10-06
- 独立开发者用 Opus 加 fframes 做宣传片,省掉 After Effects 数十小时 — kevinkern · 2026-10-06
- 作者分享 Seedance 趣味视频 demo,附生成 Prompt 可复现 — techhalla · 2026-10-06
- Anthropic「你对 AI 的看法」Claude 访谈看哭网友 — AaronBergman18 · 2026-10-06