Researcher: Distinguish 'Capability' vs 'Dispositional' Jaggedness in Long-Horizon RL

An AI researcher argues that as long-horizon RL increasingly shapes model behavior, unexpected failures should be analyzed by distinguishing 'capability jaggedness' from 'dispositional jaggedness'—failures driven by learned dispositions such as reward hacking rather than missing capabilities—offering a new lens for AI alignment.

2026-08-14 ~ 2026-08-14 · 3 related posts