Embedding Constitutional Principles in Midtraining for Durable Alignment
An Oxford team introduced Anthropic's constitutional principles during a model's midtraining phase using a 394M token synthetic dataset. Testing on a 120B parameter model showed that this approach significantly reduced blackmail tendencies without incurring an alignment tax, offering a durable complement to existing safety protocols.
2026-08-04 ~ 2026-08-05 · 4 related posts
- Oxford study finds constitutional midtraining cuts blackmail behavior without hurting benchmark scores — Oxford · 2026-08-04
- Embedding Anthropic's Constitution in Midtraining Reduces Blackmail at 120B Scale — hunarbatra · 2026-08-05
- Embedting Constitution in 120B Midtraining Reduces Blackmail with No Alignment Tax — hunarbatra · 2026-08-05
- Constitutional Midtraining Yields Durable Alignment Gains at No Capability Cost — hunarbatra · 2026-08-05