网友实测「仅凭权重检测后门 LoRA」论文:结论是可轻松绕过
Ok-Exchange-762 · reddit · 2026-09-13
楼主受「毒化 LLM 只需近常数样本」论文启发,关注一篇声称可以从权重本身检测后门、无需运行模型的新 preprint,于是自己给一个小模型植入后门并复现了检测方法。
结论:
- 思路确实可行,零样本运行即可发现后门痕迹
- 但作者认为该方法很容易被对抗性绕过,检测并非可靠屏障
- 详细实验复盘见其博客 write-up,附论文链接(arxiv 2510.07192、2602.15195v3)
「安全」频道最新
- Anthropic 9 月滥用报告:网络攻击风险需形式化方法防御 — sethlazar · 2026-09-13
- Dean Ball:METR 优秀但不够,需多元独立 AI 评估生态 — deanwball · 2026-09-13
- 从 Insull 电力垄断史看 AI 监管:低创新高监管或持续百年 — neil_chilson · 2026-09-13
- 问了圈内人:中国科技圈其实不太把 AI 安全当回事 — SydSteyerhart · 2026-09-13
- 评论称 AI 头部厂商炒作生存威胁,实为借监管压制初创对手 — AlexTensor · 2026-09-13
- AI 风险核心是责任归属,身份协议是绑定 Agent 行为的关键 — csuwildcat · 2026-09-13