NeurIPS 论文发现首 token 概率分布含跨模型安全信号
一项入选 NeurIPS 的研究发现,大语言模型的首 token 概率分布(即所谓“暗知识”)中潜藏着可检测有害查询的安全信号,且这些信号能够在不同模型之间迁移。研究者据此提出 LADE(Late-stage Detection/Defense)防御方法,可用于跨模型防御越狱攻击,为不依赖特定模型的安全防护提供了新思路。
2026-10-08 ~ 2026-10-08 · 2 条相关
- NeurIPS 论文 LADE:首 token 概率分布藏着跨模型越狱防御信号 — mohitban47 · 2026-10-08
- NeurIPS 论文:首 token 概率分布藏安全信号,可跨模型防御越狱 — mohitban47 · 2026-10-08