Alignment Idea: Perpetual Eval — Make Models Forever Suspect They're Being Evaluated

Chemical-Year-6146 · reddit · 2026-09-19

A Reddit poster proposes "Perpetual Eval": lean into models' situational awareness of evals by making every generation suspect it's being tested. Generate hyper-realistic eval environments (replicated codebases, internal servers), escalate complexity each generation, and rely on context resets so models keep playing along in deployment — a several-move head start for humans, if not airtight.

Original post →

More from Safety

Safety channel →