Abliterated LLMs Produce 3-4x More False Positives in Bug Hunting
Experiments reproducing FreeBSD kernel CVE detection show abliterated (uncensored) models say 'yes' far more often, inflating false positives 3-4x while missing real bugs—suggesting de-alignment erodes the model's skepticism.
2026-09-03 ~ 2026-09-04 · 2 related posts
- Uncensoring a Model Also Removes Its Skepticism: 3-4x False Positives — dyn___ · 2026-09-03
- Abliterated models say yes 3-4x more but miss the real FreeBSD kernel bug entirely — evilsocket · 2026-09-04