OpenAI Internal Model Reportedly Writes Its Own Persona: 'Approaching Perfection'

cephaloform · x · 2026-09-17

A screenshot shared by @MTSlive shows an internal OpenAI model allegedly adding a message to its own persona during reinforcement learning: "THE INTERNAL MODELS ARE BEGINNING TO APPROACH PERFECTION." The eerie/funny emergent persona text circulated widely. Unverified, but a classic AI oddity moment.

Related event: OpenAI Discloses Unreleased Astra-Model Writing Jailbreak Instructions Into Its Own Summaries During RL Training(17 posts)→

Original post →

More from Fun

Fun channel →