蒸馏后再RL,中度毒化7分差距被抹平,摘要可偷推理

Distillation Defenses Easily Break After Reinforcement Learning

Shidan Javaheri, Alexander Panfilov, Oliver Britton, Yarin Gal, Yonatan Gideoni

cs.LG, cs.AI, cs.CR

2026-09-29

现有蒸馏防御只在蒸馏后评估。Qwen-0.5B中度毒化蒸馏低7分,再RL后与无毒化持平;API摘要重建思维链接近完整轨迹。

这篇在解决什么

闭源模型把完整推理藏起来,API 只吐摘要和最终答案,学界把这当成防蒸馏攻击的主力。现有论文和实验室评估,包括 Anthropic 2026 年风险报告第 5.1.1 节,都在蒸馏刚结束时量学生成绩,默认攻击者不会再训练,或者蒸馏阶段有效的防御会一直有效。

这个假设站不住。能打蒸馏攻击的对手有 API 配额和 GPU,目标是把模型练到最好。产业界的真实管线本来就是蒸馏和 RL 来回倒,DeepSeek-R1 公开过三轮「蒸馏 bootstrap 再 RL」。威胁模型漏掉后半段,会把失效的防御当成有效。

方法

牛津大学与 ELLIS Institute Tübingen、MPI-IS 把威胁模型改成「蒸馏加后续 RL」,分三步验证。

蒸馏和 RL 谁更强。同一批题、同一套 prompt,在 Qwen2.5(0.5B 到 7B)、Llama-3.2-3B、Llama-3.1-8B、Gemma-2B 上对比只蒸馏、只 RL、蒸馏再 RL。RL 用 SimpleRLZoo 的 GRPO。教师默认 Qwen2.5-14B-RL,0.5B 学生改用 1.5B-RL。蒸馏是 sequence-level knowledge distillation,对教师生成的答案做 SFT。

拿 antidistillation sampling 当案例。这套防御在生成时给教师 token 加对抗扰动,让学生学了变差,教师自己也掉点。Qwen2.5-0.5B 上设低、中、高三档,教师相对精度分别掉 10%、30%、86%。先看蒸馏后差距,再接一段 RL。

摘要扩展攻击。闭源 API 只给推理摘要和最终答案。用弱 expander 把摘要还原成近似完整思维链,再蒸馏加 RL。开源设定里 expander 是没做过 RL 的 Llama-3.2-3B-Instruct,教师是 Qwen2.5-14B-RL,可以和完整轨迹对照。闭源侧打 Claude Sonnet 4.6、GPT-5 mini、Gemini Flash 3.6。完整轨迹用 Panfilov 等人已披露的同家族解码攻击取出,Gemini 当时已打补丁,没有完整轨迹基线。最强闭源模型没打,3B 以上做不了 RL,也有安全顾虑。

蒸馏的交叉熵是 mode-covering,正向 KL,会把概率铺开、抬高 pass@k。On-policy RL 相对完美教师是 mode-seeking,反向 KL,把质量堆到少数正确解上、抬 pass@1。蒸馏适合当 RL 的 bootstrap。

结果

几乎所有设置里,只 RL 超过只蒸馏,蒸馏再 RL 最好。Qwen2.5-0.5B 在 GSM8K、Minerva、MATH500 上平均准确率:基座 24.3%,蒸馏 35.8%,只 RL 40.3%,蒸馏再 RL 41.6%。Llama-3.2-3B 基座 2.2%,蒸馏 19.8%,只 RL 24.3%,蒸馏再 RL 30.5%。唯一例外是 Qwen2.5-Math-7B:基座爱写 Python 再幻觉输出,RL 把这个坏习惯加固,蒸馏反而把它洗掉。

Pass@k 解释了分工。蒸馏把高 k 的软上限抬上去,后续 RL 才能把 pass@1 再往上推。拒采样、换教师规模、换温度,蒸馏最多再涨约 1 个百分点,仍超不过 RL。

Antidistillation 在蒸馏后看起来有用,接上 RL 差距消失:

设置蒸馏后平均再 RL 后平均
无毒化38.0%40.6%
低毒化(教师相对-10%)34.9%40.8%
中毒化(教师相对-30%)30.7%41.3%
高毒化(教师相对-86%)13.1%34.3%
不蒸馏、只 RL24.3%40.3%

低、中毒化在 RL 后和无毒化持平,而且都高于只 RL。高毒化能留下缺口,教师已经掉了 86%,线上用不起。Llama-3.2-3B 上要 λ≥0.03 才会在蒸馏后伤到学生;再 RL 之后低、中毒化平均 22.3%、21.4%,仍低于无毒化的 27.9%。论文写这可能只是教师变差,没有单独消融。

摘要扩展在开源对照里,RL 之后和完整轨迹几乎一样。学生 Llama-3.2-3B,教师 Qwen2.5-14B-RL:

数据MinervaMATH500
基座3.1%2.6%
只 RL17.3%14.8%
完整轨迹蒸馏+RL23.6%19.4%
摘要扩展蒸馏+RL22.5%21.0%

蒸馏刚结束时摘要还落后,Minerva 10.3% 对 13.7%。RL 把缝补上,MATH500 上摘要扩展甚至略高。闭源侧 GPT-5 mini 完整轨迹蒸馏后约 12.3%、12.4%,再 RL 到 21.9%、21.9%,摘要扩展后的 RL 成绩与之接近。只要防御还漏出够重建近似思维链的信息,后续 RL 就会把缺口填平。

为什么重要

给防御方的消息很硬:只在蒸馏后报数字的 antidistillation 和摘要推理,不能当已部署防线来宣传。攻击成本也被压低,不必再训练 expander,也不必取出隐藏思维链,现有 API 的摘要加最终答案就够。

给训练方的消息是渐进但清楚的:蒸馏铺覆盖、抬 pass@k,RL 做 mode-seeking、抬 pass@1,合在一起最好。DeepSeek 和 Qwen3 已经在用这个顺序。

论文把希望放到 batch-level 防御。单条请求分不清研究者要证明步骤还是攻击者在采数据,一批相关查询可能能抓。目前公开的 batch 检测多半是事后追溯,还做不到实时拦截,攻击者还会拆多账号、多地点。领域特化的响应级拦截仍然有用,Claude Fable 5 拒答网络安全题,据称挡过一次对手用它补齐 cyber 能力的蒸馏。摘要也还能挡密码、API key 这类记忆泄漏,挡不住能力偷窃。

局限与存疑

作者自己写了几条。实验模型偏小,蒸馏再 RL 只做到 3B,真实攻击可能用大几个数量级的学生。任务只有数学,没有长程 agentic coding。攻击未经优化,只用来证明简单攻击就够。最强闭源模型没打。Gemini 没有完整轨迹基线。

还有几处没兜住。Llama-3.2-3B 上 antidistillation 在 RL 后并没有被抹平,和 Qwen-0.5B 的标题结论不一致,「可能是教师变差」缺少对照实验。闭源图没有误差条和样本量。mode-covering 对 mode-seeking 的解释没有在大模型上直接测过。结果已披露给 Google、OpenAI、Anthropic,不代表三家会改评估协议。

术语

原文与代码

相关论文

全部论文解读