RL 推导系列与斯坦福 AA203 十九讲深度复盘
工程师 James Le(lejames94)发布强化学习推导系列:第 18 条展开 log pθ(τ) 求导,初始状态项与动力学项自动消去,模型从方程中自然退出,揭示 REINFORCE 即奖励加权似然;第 18-19 条进一步指出对线性系统可学模型并规划,但其余场景不行——规划器会主动找出模型最讨喜的错误。他还用三周刷完斯坦福 AA203《最优与学习控制》全部 19 讲(Marco Pavone 与 Daniele Gammelli 主讲),完成从最优控制到 PPO 的深度复盘。
2026-10-09 ~ 2026-10-09 · 4 条相关
- 实测 Magnific One:生成 800+ 图,draft 快、角色一致还能写字 — techhalla · 2026-10-09
- Magnific One 限时 7 天免费用,作者开放 100+ prompt 供试玩 — techhalla · 2026-10-09
- Magnific One 三大亮点:真人质感人脸、一次写对文字、可读信息图 — techhalla · 2026-10-09
- 单张参考图锁定人物形象:新版图像模型实测文字与信息图也稳 — techhalla · 2026-10-09