Adversarial poetry powers agent attacks on oversight, transfers to unseen monitors
alexbilz · x · 2026-10-04
Alex Bilz observes that adversarial poetry now fits into agents' adaptive attacks on their own oversight: attacks spanning multiple agents and sessions that transfer to unseen monitors — poetic adversarial inputs emerging as a new attack surface against AI safety monitoring.
More from Safety
- Prosecutors Seek Nearly 4 Years for $8M AI Music Streaming Royalty Scam — Eastern-Opposite9521 · 2026-10-04
- Minneapolis council votes 7-6 to force drivers in robotaxis; Mayor Frey vetoes it as a backdoor ban — Afinetheorem · 2026-10-04
- OpenAI safety leader quits, warning AI company's culture is 'broken' — jethronethro · 2026-10-04
- Polymarket Opens Bets on Which AI Lab Pauses Training in 2026, OpenAI at 10% — Polymarket · 2026-10-04
- OpenAI Safety Employee Resigns After 3.5 Years, Says Company Culture Is Broken — Polymarket · 2026-10-04
- Reddit essay rebuts Hinton: no testable evidence AI already has subjective experience — WhoReallyKnowsThis · 2026-10-04