NeurIPS 论文:首 token 概率分布藏安全信号,可跨模型防御越狱

mohitban47 · x · 2026-10-08

研究者公布 NeurIPS 论文,发现 LLM 的首 token 概率分布(暗知识)中含有可检测有害查询的潜在安全信号,且这些信号能在不同模型间迁移。基于此提出 LADE(Latent Safety Signals for Defense),一种模型无关的越狱攻击防御方法,无需访问模型内部隐藏状态即可在模型生成第一个 token 前识别有害查询。

所属事件:NeurIPS 论文发现首 token 概率分布含跨模型安全信号(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →