开源仓库:用 Notebook 从零实现 Q-learning 到 PPO 等强化学习算法
ZabihullahAtal · x · 2026-09-05
ChristianOrr 的 GitHub 仓库 reinforcement-learning-algorithms 提供了一套从零手写的强化学习算法实现,覆盖从表格型方法到深度强化学习,刻意只保留核心要素便于理解。
包含的 Notebook 有:Q-learning、Double Q-learning、SARSA(含函数近似与 Acme 版本)、REINFORCE(含 baseline)、Actor-Critic、A2C(离散动作)、GAE/Monte-Carlo 变体等,并附运行视频与环境工具。
所属事件:强化学习开源资源两则:从零实现算法与经典清单(2 条相关)→
「研究」频道最新
- Nature 子刊发表 AI 自适应虚拟筛选方法,加速大规模配体发现 — anshulkundaje · 2026-09-05
- Chollet 断言所有 AI 必收敛于符号学习,混合范式仍是圣杯 — burny_tech · 2026-09-05
- Anthropic 模型用 Lean 形式化费马大定理,1340 万行代码收官百年难题 — littmath · 2026-09-05
- GPT-6 Astra 创 Epoch 能力指数 169 纪录,数学与长程学习刷新榜 — rohanpaul_ai · 2026-09-05
- SemiAnalysis 报告:智谱探索 Loop Transformer,环境搭建成智能增长新瓶颈 — ricklamers · 2026-09-05
- Figure AI 人形机器人数据集 INDEX 每周新增 200 万条真人视频 — Distinct-Question-16 · 2026-09-05