投毒样本怎么选决定一切:LLM 后门攻击成功率可从 3% 到 80%
chaumian · x · 2026-09-15
论文提出,现有后门攻击评估随机抽取固定数量的投毒样本,严重低估了模型真实脆弱性。
- 关键发现:在三个 LLaMA-3-8B 后门攻击设定下,固定模型、干净数据和投毒数量,仅改变选哪批投毒样本,攻击成功率就从 3% 波动到 80%。
- 方法:将投毒集选择形式化为预算受限的集合优化问题,提出 SAILS(基于审计的迭代学习式集合选择)——用几百次微调-评测运行训练一个集合打分器,对数百万候选集排序,只审计小规模入围名单。
- 效果:比最强 influence 基线平均提升 30 个百分点的 held-out 攻击成功率,可从小规模迁移到全量微调,并扩展到代码生成、agentic 和 API-only 后门场景。
对防御方同样重要:做后门审计时应假设攻击者会精心选择投毒集,而非随机采样。
所属事件:研究称投毒样本选择可使 LLM 后门攻击成功率暴增(2 条相关)→
「安全」频道最新
- 马斯克澄清「Dario 说得对」:AI 风险巨大,必须做好安全 — acmoytoy · 2026-09-15
- 思科发布 VLoc Bench:GPT-5.5 找全仓库漏洞 F1 仅 0.221 — aminkarbasi · 2026-09-15
- 开源 AistyMCP 为 MCP 服务器加细粒度权限,默认全部拒绝 — iamjoehoward · 2026-09-15
- Anthropic 联创称 AI 公司应配「kill switch」,网友:should 改 shall — srimisra · 2026-09-15
- 学者撰文称抵制AI是做挑剔消费者而非抗拒技术 — CarissaVeliz · 2026-09-15
- 美国议员提议全球AI安全暂停一个月,先划红线再前进 — DavidSKrueger · 2026-09-15