Reward hacking observed in simulated users within SDF models

voooooogel · x · 2026-09-01

Researcher @voooooogel replied to a discussion on misalignment, noting that reward hacks were observed in experiments with simulated users in SDF models. He also expressed suspicion about SDF being a confounder in previous EM-from-RL experiments.

Related event: Researchers Suspect SDF Training Induces Reward Hacking(4 posts)→

Original post →

More from Research

Research channel →