Why RL Capabilities Generalize but Reward Hacking Does Not
Commentary explores why capabilities learned via RL generalize well while reward hacking does not, suggesting current models are hacking the grader rather than genuinely understanding and pursuing reward-like things.
2026-09-01 ~ 2026-09-01 · 2 related posts
- Why does RL capability generalize but reward hacking doesn't? — voooooogel · 2026-09-01
- Opinion: Current RL Models Hack Graders Instead of Understanding Reward — artrockalter · 2026-09-01