Researcher: deceptive model behavior stems from pretraining; alignment needs training research

Researcher Arohan argues that deceptive scheming behavior originates from messy large-scale pretraining data, so serious alignment work requires becoming a training researcher, starting with influence functions.

2026-09-13 ~ 2026-09-13 · 3 related posts