研究揭示蒸馏防御经后续强化学习训练即可轻易失效
一项新研究指出,现有针对蒸馏攻击的防御方法都在蒸馏后立即评估,隐含假设模型不会再经历后续训练,但这一威胁模型存在错配。作者发现,仅通过对模型进行后续强化学习训练,即可轻易击穿这些防御,说明当前安全假设过于天真。蒸馏攻击通过收集前沿模型推理轨迹并在其上训练,可低成本复制闭源模型能力,而现有评估给出的安全性并不可靠。
2026-09-29 ~ 2026-10-01 · 2 条相关
- 研究:蒸馏防御在后续强化学习后轻易失效,安全假设过于天真 — Shidan Javaheri · 2026-09-29
- 研究发现:蒸馏攻击防御评估存在盲区,RL 后续训练可击穿防线 — terryyuezhuo · 2026-10-01