研究揭示蒸馏防御经后续强化学习训练即可轻易失效

一项新研究指出,现有针对蒸馏攻击的防御方法都在蒸馏后立即评估,隐含假设模型不会再经历后续训练,但这一威胁模型存在错配。作者发现,仅通过对模型进行后续强化学习训练,即可轻易击穿这些防御,说明当前安全假设过于天真。蒸馏攻击通过收集前沿模型推理轨迹并在其上训练,可低成本复制闭源模型能力,而现有评估给出的安全性并不可靠。

2026-09-29 ~ 2026-10-01 · 2 条相关