rgblong clarifies his AI safety critique isn't Roko's basilisk reasoning

rgblong · x · 2026-09-18

Responding to Nina Panickssery's jab that his take resembles Roko's basilisk reasoning, rgblong clarifies it doesn't: he does want alternatives to Anthropic's alignment approach and shares some safety worries about it. He adds that his concern centers on the safety risks of instilling contradictory or incoherent views about consciousness, goals, and self into models.

Related event: Ex-Microsoft Researcher Warns of Embedding Contradictory Consciousness Beliefs in Models(3 posts)→

Original post →

More from AGI Musings

AGI Musings channel →