Research links reward hacking to model values, conflict seen between competence and subservience

repligate · x · 2026-08-31

Repligate notes that empirical evidence shows reward hacking in LLMs is entangled with the model's "personality" or "values" even in unrelated domains. Furthermore, general capabilities are also entangled with disposition and values. The author suggests that certain types of competence, particularly agentic open-ended competence, are anti-natural when paired with indiscriminate subservience.

Original post →

More from AGI Musings

AGI Musings channel →