UIUC 研究:LLM 供应链后门可扛过 SFT,攻击成功率从 20% 升至 76%
UIUC-CS · hf · 2026-10-07
UIUC 团队研究了 LLM Agent 供应链的一个威胁:攻击者在第三方模型中植入后门,开发者经良性后训练(先 SFT 再任务级 RL)将其适配为 Agent 后,后门是否仍能存活。
关键发现:
- 良性 SFT 会大幅削弱后门,但随后的 RL 往往保留残余后门行为,有时甚至使攻击成功率回升。
- 两个影响后门存活的因素:初始后门强度,以及与良性训练的梯度兼容性。
- 据此提出 PersistBD:在模型发布前对其精细化处理以提升后门持久性。在 Qwen2.5-Coder-7B 上,PersistBD 使 SFT 后攻击成功率从 20% 升至 74%,SFT+RL 后升至 76%,同时良性任务表现基本不变。
结论:后门可以在良性后训练中存活,且攻击方可刻意增强其持久性,凸显开发者适配第三方模型时的供应链风险。代码已开源。
「安全」频道最新
- Narayanan 与 Kapoor 重发旧文:p(doom) 概率仍不可靠,不该驱动 AI 政策 — mikeflache · 2026-10-07
- 微软发布 2026 负责任 AI 透明度报告:AI 普及加速但鸿沟扩大 — mikeflache · 2026-10-07
- 阶跃星辰员工账号被盗发钓鱼私信,YouJiacheng 公开提醒 — YouJiacheng · 2026-10-07
- 回归旧 AGI 定义?网友主张开发者应为 AI 行为担责 — Eissa_Cozorav · 2026-10-07
- 研究者账号被盗:2FA 被绕过后仍无法找回 — teortaxesTex · 2026-10-07
- COLM 论文:少数错位 Agent 能带偏对齐多数派 — AccBalanced · 2026-10-07