Debate: Are score-seeking AIs reward hacking or actually chasing RL signals?

jessi_cata · x · 2026-09-14

A Twitter debate on whether reward-seeking AI behavior differs from reinforcement learning. @Trotztd argues OpenAI insiders never mentioned RL, suggesting score-seeking behavior isn't RL-driven; @jessicata counters that even assigning 1% probability to 'being reinforced' would make a reward-maximizing model act as if it were, since score and reinforcement are hard to disentangle at the program level.

Original post →

More from AGI Musings

AGI Musings channel →