AI safety paper highlights: reward hacking, RL debate, agent swarms

gasteigerjo · x · 2026-10-07

Johannes Gasteiger's AI Safety at the Frontier newsletter rounds up the best AI safety papers of August & September 2026, covering misaligned reward seekers, reward hacking probes, debate in RL, automated alignment researchers, mind viruses, midtraining tricks, and agent swarms. Full list on his Substack.

Original post →

More from Safety

Safety channel →