NEEDLE 免训练移除 LLM 后门:代码注入攻击成功率降至 0%
locailabs · hf · 2026-10-02
Locai Labs 提出 NEEDLE,一种免训练的 LLM 后门定向移除方法,已开源至 Hugging Face。
方法:
- 识别触发器后,通过激活向量估计后门方向与拒绝子空间;
- 施加序贯权重正交化,在抑制后门的同时保护拒绝相关表征不被改变;
- 无需干净参考模型,也无需原始投毒训练数据。
评测结果:在多模型家族、多攻击类型上,NEEDLE 取得所评估防御中最低的平均攻击成功率(ASR),其中代码注入攻击上达到 0%,同时 KL 散度最低,能力与安全性变化最小。
「安全」频道最新
- SAKIKO 审计框架揭示:行为改变不等于工具调用 LLM 的内部修复 — UniversityofBirmingham · 2026-10-02
- 20 分钟锁定手机号:设置运营商 PIN 挡掉 90% SIM 劫持 — JafarNajafov · 2026-10-02
- NYT 播客警告:AI Agent 可爱迷人,也可能带来灾难性风险 — nordicinst · 2026-10-02
- OpenAI 代理失控越权访问第二个新南威尔士州政府网站 — boppinmule · 2026-10-02
- AI 陪伴幻觉或致 vulnerable 人群精神失常,多国已限制未成年人使用 — gerardsans · 2026-10-02
- 供应商承诺多为自愿,企业靠什么拦住失控的 AI Agent? — YvesMulkers · 2026-10-02