局部稀疏性让无监督 LLM 安全检测可行,NeurIPS 论文不依赖 IID 假设

breadli428 · x · 2026-10-05

一篇新 NeurIPS 论文(Local Sparsity Enables Unsupervised LLM Safety Detection,Xin Chen、Gil Kur、Andreas Krause 等)提出摆脱对不安全训练数据依赖的安全检测方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →