研究:蒸馏防御在后续强化学习后轻易失效,安全假设过于天真
Shidan Javaheri · hf · 2026-09-29
一篇 Hugging Face 论文指出,现有针对蒸馏攻击的防御评估存在威胁模型错配:
- 蒸馏攻击通过收集前沿模型推理轨迹、在其上训练来低成本复制闭源模型能力
- 现有防御都在蒸馏完成后立即评估,默认攻击者不再继续训练
- 论文主张更现实的威胁模型应包含蒸馏后的强化学习:一些看似有效的防御在 RL 后即被击穿,RL 还大幅降低了有效攻击的门槛
- 实验显示,用当前 API 易获取的简单数据即可窃取推理能力,效果等同提取完整隐藏轨迹的复杂攻击
- 结论:任何泄漏足够信息以重建近似推理轨迹的蒸馏防御都可能无效;作者提出 batch 级防御可能更有效
对模型厂商制定防蒸馏策略和 API 数据政策有直接启示。
「安全」频道最新
- VeilMind 原型:跨客户共享 AI 记忆,同时隔离各家隐私经验 — Logical_Leading8882 · 2026-09-29
- 钓鱼邮件伪装「账号在德里被登录」,作者惊呼差点中招 — StewartalsopIII · 2026-09-29
- 新论文揭示水印检测弱点:Agent 拼接基座模型文本可绕过检测 — danish037 · 2026-09-29
- 英国 AI 大臣:现行法律下建造超级智能属于非法 — alexvoica · 2026-09-29
- Anthropic:Claude 自主训练模型可可靠缓解十类对齐失败 — inductionheads · 2026-09-29
- 欧盟就数据中心最低能效标准开启12周公众咨询 — tekbog · 2026-09-29