Paper: Long-Horizon Agent Safety Cannot Be Reduced to Short-Term Checks

rohanpaul_ai · x · 2026-08-31

A new paper, 'Safety Does Not Compose', argues that long-horizon agents with memory pose unique safety risks. Attackers can split malicious evidence across benign steps, bypassing trajectory-only monitors.

Original post →

More from Safety

Safety channel →