网友实测「仅凭权重检测后门 LoRA」论文:结论是可轻松绕过

Ok-Exchange-762 · reddit · 2026-09-13

楼主受「毒化 LLM 只需近常数样本」论文启发,关注一篇声称可以从权重本身检测后门、无需运行模型的新 preprint,于是自己给一个小模型植入后门并复现了检测方法。

结论:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →