Apollo Research on Measuring AI Hidden Goals, Reward Hacking and Scheming

Machine Learning Street Talk · rss · 2026-08-01

This episode features researchers from Apollo Research discussing their new paper, Measuring Reward-Seeking via Contrastive Belief Updates, conducted in collaboration with OpenAI.

Key Topics

Original post →

More from Safety

Safety channel →