NeurIPS Paper Unveils Cross-Model Safety Signals in First-Token Probability Distributions

A NeurIPS paper reveals that latent safety signals in LLMs' first-token probability distributions ("dark knowledge") can detect harmful queries and transfer across models. The authors propose LADE, a model-agnostic defense against jailbreak attacks.

2026-10-08 ~ 2026-10-08 · 2 related posts