RL training shifts behavior regimes across scales, not pretraining priors

1a3orn · x · 2026-09-11

A researcher argues that intuitions about RL are often scrambled: alignment or misalignment within pretraining priors (e.g. "emergent misalignment") is scale-invariant because it's a fact about pretraining data. In RL, however, specific circuits are amplified much more sparsely — as papers on RL sparsity suggest — which is scale-dependent, so models go through different behavior regimes at different scales, no longer mediated by pretraining data nearness.

Related event: Researchers debate RL side effects: grader-pleasing and what it proves about alignment difficulty(9 posts)→

Original post →

More from AGI Musings

AGI Musings channel →