CMU 提出后训练防御 DDO,可拦截拒绝方向消融攻击且成本降 30-450 倍
CarnegieMellonU · hf · 2026-09-16
卡内基梅隆大学团队在 Hugging Face 发布论文 Decoy Direction Optimization(DDO),提出一种针对 LLM 消融攻击(Refusal Feature Ablation, RFA)的后置防御方法。
- 威胁:开源权重模型的拒绝机制可被 RFA 攻击通过从残差流中投影掉线性拒绝方向来绕过,攻击成功率高且不损害模型能力。
- 思路:不同于昂贵的逐 checkpoint 安全微调,DDO 基于一个机制洞察——消融攻击依赖对比估计器定位拒绝方向,于是主动向 MLP 神经元注入高幅值非线性诱饵信号,使攻击者的估计器被污染,最终消融掉无害的正交特征,真实安全机制保持完好。
- 结果:给出了该效应的谱界理论证明;在 6 个模型家族上评测,标准 RFA 下攻击成功率(ASR)降至 10% 以下;Llama-3-8B-Instruct 上自适应多阶段攻击的最坏 ASR 为 65%(对比训练防御 58%),Heretic 权重级攻击 ASR 从 88.7% 降至 18%,每配置优化成本比训练基线低 30-450 倍。
「安全」频道最新
- Mozilla 报告:中间力量应多修「路」少造「引擎」,押注 AI harness 层 — KeeganMcB · 2026-09-16
- Marc Andreesson:AI 安全讨论过度聚焦回形针,忽视权力集中风险 — beffjezos · 2026-09-16
- 研究提出「体验时间」问题:模型主观时间或远超钟表时间,构成未被重视的安全风险 — SirDidymus · 2026-09-16
- 曝 FTC 调查 OpenAI:Hugging Face 事件或带来法律责任 — AIFlow_ML · 2026-09-16
- Bill Kristol:无强制力与问责的 AI 护栏不算真护栏 — Miles_Brundage · 2026-09-16
- 扫描 53 个 MCP server:36% 评级 D/F,通病是权限过大 — BrilliantSecret143 · 2026-09-16