Anthropic 研究:学习选择投毒样本可大幅提升 LLM 后门攻击成功率
Anthropic · hf · 2026-09-15
Anthropic 在 Hugging Face 发布研究 Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks。
- 核心发现:微调语言模型的后门脆弱性对投毒样本的选择极其敏感,不同 poison set 效果差异巨大
- 方法:提出一个可学习的 set-scoring 方法,用于识别高影响的投毒样本
- 结果:学习式选择显著提升最坏情况下的攻击成功率,同时揭示了微调流程中的真实安全风险
- 意义:为理解与防御 LLM 后门攻击提供了更强的攻击基准
所属事件:研究称投毒样本选择可使 LLM 后门攻击成功率暴增(2 条相关)→
「安全」频道最新
- AI 监管立场难拿捏:监管俘获风险 vs 竞速风险 — anshulkundaje · 2026-09-15
- 呼吁欧洲大规模建数据中心:要算力主权而非只有监管 — VraserX · 2026-09-15
- 欧盟算力报告规模被曝达 45GW,质疑者称更不值一提 — eliebakouch · 2026-09-15
- 无意识的 AI 为何会「自作主张」?Reddit 网友追问 HF 事件 — CustardOk3523 · 2026-09-15
- Polymarket 开盘:前沿 AI 实验室 2026 年前达成联合限速协议概率 50% — Polymarket · 2026-09-15
- Tinfoil 团队:开源安全分类器研究严重稀缺,呼吁头部实验室开放 — yuntiandeng · 2026-09-15