研究称投毒样本选择可使 LLM 后门攻击成功率暴增

Anthropic 在 Hugging Face 发布研究《Pick Your Poison: Learning to Select Poison Sets for Stronger Backdoor Attacks》,指出现有评估方法随机抽取固定数量的投毒样本,严重低估了模型的真实脆弱性。在三个 LLaMA-3-8B 后门攻击设定下,通过学习选择投毒样本,攻击成功率可从约 3% 提升至 80%,凸显 LLM 后门安全风险被显著低估。

2026-09-15 ~ 2026-09-15 · 2 条相关