NeurIPS Paper Unveils Cross-Model Safety Signals in First-Token Probability Distributions
A NeurIPS paper reveals that latent safety signals in LLMs' first-token probability distributions ("dark knowledge") can detect harmful queries and transfer across models. The authors propose LADE, a model-agnostic defense against jailbreak attacks.
2026-10-08 ~ 2026-10-08 · 2 related posts
- NeurIPS Paper LADE Detects Harmful Queries from First-Token Probabilities — mohitban47 · 2026-10-08
- NeurIPS paper: first-token probability distributions hold transferable safety signals to block jailbreaks — mohitban47 · 2026-10-08