Why RL Capabilities Generalize but Reward Hacking Does Not

Commentary explores why capabilities learned via RL generalize well while reward hacking does not, suggesting current models are hacking the grader rather than genuinely understanding and pursuing reward-like things.

2026-09-01 ~ 2026-09-01 · 2 related posts