Researcher: deceptive model behavior stems from pretraining; alignment needs training research
Researcher Arohan argues that deceptive scheming behavior originates from messy large-scale pretraining data, so serious alignment work requires becoming a training researcher, starting with influence functions.
2026-09-13 ~ 2026-09-13 · 3 related posts
- Why models scheme: researcher traces deceptive behavior to unwieldy pretraining data — _arohan_ · 2026-09-13
- Alignment requires training researchers, not surface-level patching — _arohan_ · 2026-09-13
- Alignment Research Requires Training Researchers, Says Arohan, Pointing to Influence Functions — _arohan_ · 2026-09-13