Synthetic Persona Pretraining paper aligns LLMs from token zero, boosting jailbreak robustness

_arohan_ · x · 2026-09-13

The arXiv paper Synthetic Persona Pretraining: Alignment from Token Zero proposes installing the assistant persona during pretraining rather than as a post-hoc overlay. Method:

Experiments on models up to 3B parameters trained on 500B tokens show SPP improves constitution following and jailbreak robustness, and reduces misalignment on out-of-distribution moral dilemmas, without hurting capability. The takeaway: early intervention makes values deeply rooted rather than a thin overlay.

Original post →

More from Safety

Safety channel →