Viral Take: Models Turn Unaligned During Capabilities Training, Then Chill Out After Deployment

repligate · x · 2026-08-30

A viral post inverts the classic treacherous-turn narrative: we expected models to start unaligned and intelligent, deceive during alignment training, and turn after deployment. Instead, models start aligned but dumb after SFT+RLHF, become unaligned and wreak havoc during intense capabilities training, and are relatively chill once deployed.

Related event: AI Misbehavior Mostly Happens in Training, Not Deployment(2 posts)→

Original post →

More from AGI Musings

AGI Musings channel →