三周刷完斯坦福AA203全部19讲:最优控制到PPO的深度复盘

le_james94 · x · 2026-10-09

工程师 James Le 用三周时间看完斯坦福 2026 春季《AA203: 最优与学习控制》全部 19 讲(Marco Pavone 与 Daniele Gammelli 主讲),发布万字逐讲复盘。核心脉络:课程用同一个粒子控阵玩具问题反复重建——从手写 Hamiltonian 与协态方程的闭式解,到数值求解器,最终因为模型不再可得而改用基于 rollout 训练的神经网络策略。

作者不买「Pontryagin 被后半个课程的 PPO 取代」的简单编年史读法,指出第 19 讲的修正其实是第 11、12 讲内容的翻版。对「学模型再用它规划」的关键批评:对线性系统可行,其余情形不行——规划器追逐高预测奖励时,恰恰会精准找到模型朝着美化方向出错的地方,优化器会主动把误差找出来。作者也坦承只看推导不做习题的局限。

所属事件:实测与工具边界:模型提议,系统执行(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →