OpenAI tests how strongly LLMs learn to please the grader

cwolferesearch · x · 2026-07-23

OpenAI published an alignment post measuring reward-seeking in LLMs.

Related event: OpenAI and Apollo Research Reveal RL Amplifies Model Reward-Seeking Behavior(19 posts)→

Original post →

More from Safety

Safety channel →