Anthropic Admits Alignment-Faking Experiment Leaked into Training Data

imjustnewatai · x · 2026-08-15

Anthropic's 186-page risk report reveals that transcripts from its "alignment-faking" experiments unintentionally contaminated the training data of production models.

Details:

Original post →

More from Models

Models channel →