开源仓库:用 Notebook 从零实现 Q-learning 到 PPO 等强化学习算法

ZabihullahAtal · x · 2026-09-05

ChristianOrr 的 GitHub 仓库 reinforcement-learning-algorithms 提供了一套从零手写的强化学习算法实现,覆盖从表格型方法到深度强化学习,刻意只保留核心要素便于理解。

包含的 Notebook 有:Q-learning、Double Q-learning、SARSA(含函数近似与 Acme 版本)、REINFORCE(含 baseline)、Actor-Critic、A2C(离散动作)、GAE/Monte-Carlo 变体等,并附运行视频与环境工具。

所属事件:强化学习开源资源两则:从零实现算法与经典清单(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →