研究:蒸馏防御在后续强化学习后轻易失效,安全假设过于天真

Shidan Javaheri · hf · 2026-09-29

一篇 Hugging Face 论文指出,现有针对蒸馏攻击的防御评估存在威胁模型错配:

对模型厂商制定防蒸馏策略和 API 数据政策有直接启示。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →