RL 推导系列与斯坦福 AA203 十九讲深度复盘

工程师 James Le(lejames94)发布强化学习推导系列:第 18 条展开 log pθ(τ) 求导,初始状态项与动力学项自动消去,模型从方程中自然退出,揭示 REINFORCE 即奖励加权似然;第 18-19 条进一步指出对线性系统可学模型并规划,但其余场景不行——规划器会主动找出模型最讨喜的错误。他还用三周刷完斯坦福 AA203《最优与学习控制》全部 19 讲(Marco Pavone 与 Daniele Gammelli 主讲),完成从最优控制到 PPO 的深度复盘。

2026-10-09 ~ 2026-10-09 · 4 条相关