研究发现:蒸馏攻击防御评估存在盲区,RL 后续训练可击穿防线

terryyuezhuo · x · 2026-10-01

一项新研究指出,现有针对蒸馏攻击(distillation attacks)的防御方法都是在蒸馏之后立即评估的,隐含假设模型不再经历后续 RL 训练。作者发现这一假设使现有评估给人虚假的安全感:经过 RL 训练后,简单的攻击手段就能重新生效,击穿这些防御。对模型安全与蒸馏攻防领域是重要的实证警示。

所属事件:研究揭示蒸馏防御经后续强化学习训练即可轻易失效(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →