Geodes Paper Uses Special Token to Control Misalignment Generalization
Geodes Research's new paper introduces a method for selective generalization of misalignment: during midtraining, models learn a special token from synthetic documents describing AI misalignment, enabling targeted control over where misaligned behaviors generalize.
2026-09-16 ~ 2026-09-16 · 2 related posts
- Geodes paper: selective generalization of misalignment via token-marked midtraining — sebkrier · 2026-09-16
- New paper uses a special token to control how broadly AI misalignment generalizes — dhadfieldmenell · 2026-09-16