Anthropic 研究员新论文:投毒样本怎么选,后门攻击成功率 3% 到 80%
chhaviyadav_ · x · 2026-09-30
Anthropic Fellows 项目发布论文《Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks》,研究 LLM 后门攻击中投毒样本的选择问题。
- 后门投毒即在模型微调数据中掺入恶意样本,使模型在触发词出现时行为异常
- 现有评估只关注攻击者能投毒多少样本,该工作研究应该选哪些样本
- 在投毒数量固定不变的情况下,仅凭选择不同的投毒集合,攻击成功率就能从 3% 波动到 80%
- 说明「选哪几条」比「投多少条」更关键,对防御侧评估有直接影响
「安全」频道最新
- Google 研究为 AI 设计蛋白质加水印,助识别潜在生物威胁 — Ars Technica AI · 2026-09-30
- X 将允许把 Grok 拉进群聊,加密与访问权限细节曝光 — XFreeze · 2026-09-30
- 白宫 AI 协议签了:六巨头承诺自审,特朗普称"道德上约束力" — Don't Worry About the Vase (Zvi) · 2026-09-30
- AI 真正的威胁:权力被少数大公司锁死,开源是答案 — dansitu · 2026-09-30
- DeepMind 推出 SynthID Bio:给 AI 设计的蛋白质打上可检测水印 — TorturedPoet30 · 2026-09-30
- 让 AI 自下而上学「更 wise」的价值:智慧梯度方法被重新提起 — edelwax · 2026-09-30