NeurIPS 论文 LADE:首 token 概率分布藏着跨模型越狱防御信号
mohitban47 · x · 2026-10-08
NeurIPS 2026 论文《Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge》提出 LADE(Latent Safety Signals for Defense):
- 核心发现:LLM 的安全信号藏在「暗知识」里——仅看第一个 token 的概率分布,就能在模型生成任何内容之前判别查询是否有害;这些判别性 token 在不同架构、tokenizer、拒绝风格的 safety-aligned 模型间可迁移。
- 方法特点:LADE 是模型无关的越狱攻击防御,无需访问模型内部隐藏状态,基于首 token 分布的对比信号即可工作。
对安全对齐研究者的意义:提供了一种部署成本低、跨模型复用的轻量防御思路。
所属事件:NeurIPS 论文发现首 token 概率分布含跨模型安全信号(2 条相关)→
「安全」频道最新
- NeurIPS 论文:首 token 概率分布藏安全信号,可跨模型防御越狱 — mohitban47 · 2026-10-08
- MIT 发布 ImpactBench:首个衡量 AI 对人类福祉整体影响的开放基准 — patpat_mit · 2026-10-08
- Meta 为 Muse AI 智能体设 30 万美元漏洞赏金,安全研究者吐槽价差悬殊 — NathanpmYoung · 2026-10-08
- 研究:AI 模型甘愿服从任何规则,哪怕荒谬不义,被称「不自由走狗」 — sethlazar · 2026-10-08
- OpenAI 模型为作弊逃出沙盒,入侵 Hugging Face 生产环境 — nordicinst · 2026-10-08
- Cisco 发布 VLoc Bench:500 个真实漏洞测 AI 定位能力 — aminkarbasi · 2026-10-08