NEEDLE 免训练移除 LLM 后门:代码注入攻击成功率降至 0%

locailabs · hf · 2026-10-02

Locai Labs 提出 NEEDLE,一种免训练的 LLM 后门定向移除方法,已开源至 Hugging Face。

方法:

评测结果:在多模型家族、多攻击类型上,NEEDLE 取得所评估防御中最低的平均攻击成功率(ASR),其中代码注入攻击上达到 0%,同时 KL 散度最低,能力与安全性变化最小。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →