New SPP Method Aligns Model Values via Pretraining
A new paper proposes Synthetic Persona Pretraining (SPP), injecting synthetic moral reflections during pretraining to significantly alter values and improve alignment in 3B models.
2026-08-14 ~ 2026-08-15 · 2 related posts
- New Paper: Injecting Synthetic Moral Reflections During Pretraining Shifts Value Priorities in 3B Models — sethlazar · 2026-08-14
- Synthetic Persona Pretraining (SPP): Injecting Desired Persona from Token Zero Boosts Alignment in 3B Models — dhadfieldmenell · 2026-08-15