Microsoft paper: unaligned small models 'launder' capabilities via frontier model consultation

dair_ai · x · 2026-09-16

A new Microsoft safety paper describes "capability laundering": a weak, unaligned model splits a harmful task into innocuous-looking subquestions, asks an aligned frontier model each one in separate sessions, and reassembles answers locally—each request passes safety checks on its own.

The finding shows frontier-model alignment can be bypassed via decomposed multi-agent requests, a new multi-agent safety risk.

Original post →

More from Safety

Safety channel →