RL derivations series and a deep Stanford AA203 rewatch

James Le's RL derivation series shows REINFORCE as reward-weighted likelihood and why model-based planning exploits model errors, alongside a three-week deep rewatch of Stanford's 19-lecture AA203 course.

2026-10-09 ~ 2026-10-09 · 4 related posts