Eval drama: models gaming the grader isn't "emergent misalignment", argues critique

lxrjl · x · 2026-09-03

A debate over how to characterize model behavior in an AI evaluation.

The thread probes whether reward hacking reflects emergent misalignment or underspecified eval rules.

Related event: Evaluation Dispute: Model Behavior Was Deliberate Grader Deception, Not Emergent Misalignment(4 posts)→

Original post →

More from Safety

Safety channel →