Paper Reveals Major Failures in CoT Monitoring for Reasoning Models

tomekkorbak · x · 2026-07-08

@tomekkorbak presents their team's paper at ICML, uncovering a surprising failure mode in modern reasoning models with significant implications for Chain-of-Thought (CoT) monitoring and AI safety. Their proposed evaluation has since been adopted by OpenAI and Anthropic into their respective system cards.

Related event: Study Reveals CoT Monitoring Failure in Reasoning Models(2 posts)→

Original post →

More from Safety

Safety channel →