局部稀疏性让无监督 LLM 安全检测可行,NeurIPS 论文不依赖 IID 假设
breadli428 · x · 2026-10-05
一篇新 NeurIPS 论文(Local Sparsity Enables Unsupervised LLM Safety Detection,Xin Chen、Gil Kur、Andreas Krause 等)提出摆脱对不安全训练数据依赖的安全检测方法。
- 问题:现有安全检测器多为监督式,依赖不安全数据并隐含 IID 泛化假设;新攻击与新危害类别不断出现,训练时未覆盖。
- 思路:转为无监督异常检测,只建模安全数据、对分布外输入报警。论文在线性表示假设(LRH)下证明可行性:经 sparse autoencoder 恢复的表示空间中,相邻点共享一小组共同激活特征(局部稀疏性),即使不同邻域的特征集不同。
- 方法:提出基于 locally masked SAE 的异常检测框架,含理论支撑,并在六个模型家族上验证。
- 结果:允许用 1% 分布外数据做校准(不做训练)时接近最优性能,且计算只用到 1-2% 的 SAE 神经元。
「研究」频道最新
- MusicArena 上线:像 Chatbot Arena 一样众包评测 AI 音乐生成 — ycombinator · 2026-10-05
- 模态动力学字体:用有限元振动模式驱动冻结视频扩散做字形动画 — Maham Tanveer · 2026-10-05
- 4B 参数国际象棋模型 Queen 达特级大师水平,还能解释走法 — Adithya Bhaskar · 2026-10-05
- WEFT 框架:全系统协同进化,把工具使用后训练规模化到 35B — nex-agi · 2026-10-05
- FailBank 把运行时安全反馈变成长期监督,VLA 成功率最多提 25.4 点 — notredame · 2026-10-05
- Salesforce 实测:AI 智能体单轮任务成功率仅 58% — aakashgupta · 2026-10-05