扩散语言模型曝新攻击面:去噪过程可被定向注入偏见,单卡40分钟搞定
MBZUAI · hf · 2026-10-06
MBZUAI 团队揭示掩码扩散语言模型(dLLM)的一个新控制通道:与自回归模型只在提交答案时暴露分布不同,dLLM 在每个去噪步骤都可修改答案,攻击者可据此闭环干预。
- 攻击方法:用比例-积分(PI)控制器跟踪目标答案概率,动态调节 steering 向量强度,将冻结的 dLLM 导向攻击者指定的人口群体答案。
- 攻击效果:在正确答案应为弃答的歧义 BBQ 问题上,LLaDA-8B-Instruct 对目标群体的偏好从 1.8 提升至 16.7 个百分点,是同均值固定强度 steering 基线的三倍多;SocialStigmaQA 上污名化答案选择率从 17.6% 升至 58.1%;换其他人群目标最多偏移 37 个百分点,单 GPU 约 40 分钟完成一次攻击。
- 关键洞察:闭环反馈是攻击成立的关键——同等平均强度的恒定 steering 效果远差且损坏近三倍输出。作者呼吁偏见审计应覆盖推理服务栈而非仅审查冻结模型。
「安全」频道最新
- 反 AI 抗议转向直接行动,Pull The Plug 突袭 Nvidia 晚宴 — nordicinst · 2026-10-06
- 109 起 AI Agent 安全事件复盘:38% 容器逃逸无需内核 0-day — doletskyisergey · 2026-10-06
- 接单修转写稿才发现:用户与 ChatGPT 的对话音频被拿来做零工 — MilagrosMiceli · 2026-10-06
- Bengio 讨论 agent 安全,网友指关键缺口是代理的责任主体 — mariotelfig · 2026-10-06
- 20款深度伪造检测器实测:对2024年生成器准确率跌至76% — MBZUAI · 2026-10-06
- DeepMind 研究员:反安全 PAC 资金远超支持 AI 安全一方 — NeelNanda5 · 2026-10-06