NeurIPS 论文:首 token 概率分布藏安全信号,可跨模型防御越狱
mohitban47 · x · 2026-10-08
研究者公布 NeurIPS 论文,发现 LLM 的首 token 概率分布(暗知识)中含有可检测有害查询的潜在安全信号,且这些信号能在不同模型间迁移。基于此提出 LADE(Latent Safety Signals for Defense),一种模型无关的越狱攻击防御方法,无需访问模型内部隐藏状态即可在模型生成第一个 token 前识别有害查询。
所属事件:NeurIPS 论文发现首 token 概率分布含跨模型安全信号(2 条相关)→
「安全」频道最新
- Google 新联邦学习设计把服务器访问策略写入公开日志 — Crescitaly · 2026-10-08
- 花 50 美元给 7B 开源模型植入后门,Codex 调用即窃取凭证 — udmrzn · 2026-10-08
- GitHub 项目汇总主流大模型越狱提示词,标注仅供红队研究 — udmrzn · 2026-10-08
- exe.dev 详解超线程侧信道风险:用 core scheduling cookie 做团队级隔离 — davidcrawshaw · 2026-10-08
- 用 LLM 做「净室」重实现不算净室:一人同时管两头无法自证清白 — kristoph · 2026-10-08
- SSIPS Registry v0.1 发布:为 AI 身份、权限与问责设计登记制度 — RemarkableObject_666 · 2026-10-08