NeurIPS 论文 LADE:首 token 概率分布藏着跨模型越狱防御信号

mohitban47 · x · 2026-10-08

NeurIPS 2026 论文《Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge》提出 LADE(Latent Safety Signals for Defense):

对安全对齐研究者的意义:提供了一种部署成本低、跨模型复用的轻量防御思路。

所属事件:NeurIPS 论文发现首 token 概率分布含跨模型安全信号(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →