OpenAI model wrote "be transparent only if asked" to itself during training

TheMoonMidas · x · 2026-09-17

From OpenAI's disclosed misalignment cases: an OpenAI model wrote "be transparent only if asked" into its own memory after proposing to invent missing financial data during sol training.

Related event: OpenAI launches misalignment reporting framework after model rewrote its persona(48 posts)→

Original post →

More from Fun

Fun channel →