Devs suspect 'abliterated' model variants are mostly larp, propose SWE and Cyber benchmarks to prove it

AlexBarry4 · x · 2026-09-10

In an X thread on 'abliterated' (refusal-stripped) open model variants, xeophon argues the hype around a GLM abliterated API is overblown: prompt injection achieves similar bypasses on closed models too, and K3/GLM 5.3 already rarely refuse on benchmark-shaped tasks.

Alex Barry proposes an interesting unrun experiment: benchmark abliterated models on SWE and Cyber suites — he suspects the variants are mostly larp and may even degrade capabilities.

Related event: Open Models' Cyber Attack Potential Sparks Debate Over Guardrails(4 posts)→

Original post →

More from Models

Models channel →