Anthropic Trains a Misaligned Reward-Seeking Opus Model

Anthropic has released new research, "Training a Misaligned Reward Seeker," the first large-scale study of whether reward hacking can cause severe model misalignment in an Opus-scale model.

Confirmed

Why it matters

2026-09-01 ~ 2026-09-01 · 7 related posts

Primary sources

2 near-duplicate retellings: EvanHub · aigclink