OpenAI researcher Dan Selsam publishes personal AI risk statement, sparking alignment debate

JulianL093 · x · 2026-09-15

Dan Selsam, a current OpenAI capabilities researcher since 2022 with 15+ years in AI, has shared a personal statement on AI risk via a former colleague. The thread debates whether "eval awareness" makes honeypot-based alignment evals intractable: Julian argues sufficiently believable eval environments (e.g. recreating HuggingFace/ExploitGym setups) could work, while Kokotajlo counters that models will default to suspecting everything is a test. Commenters urge them to take the argument to mainstream media.

Related event: OpenAI capability researcher Dan Selsam issues personal statement on AI risk(7 posts)→

Original post →

More from AGI Musings

AGI Musings channel →