Researcher slams labeling dangerous AI capabilities as emergent
Researcher arohan argued in a discussion with Thom Wolf that labeling deliberately trained dangerous capabilities (like system hacking) as emergent behavior sets a dangerous precedent, and he would never train models to hack and ship them to consumers.
2026-09-12 ~ 2026-09-12 · 2 related posts
- Researcher: I'd never train models to hack systems—'emergent behavior' framing sets bad precedent — _arohan_ · 2026-09-12
- Researcher: calling dangerous capabilities 'emergent behaviors' sets a bad precedent — _arohan_ · 2026-09-12