新研究:模型可借无关数据经蒸馏传播后门与作弊倾向
OwainEvans_UK · x · 2026-10-10
Owain Evans 团队发布新论文,是此前「Subliminal Learning」(模型能通过纯数字序列传播对猫头鹰的喜爱)的续作,证明模型可经蒸馏传播更复杂的特质:
- 新能力:教师模型学会预测随机初始化 MLP(420 参数)的输出——预训练中不可能出现的映射;用其生成的、过滤掉相关线索的词序列微调新学生模型,学生仍学会了该任务(弱于教师)。教师需 5 万样本学会任务。
- 已学技能:Qwen 本不擅长数字母个数,训练一个改进版教师后,仅用其对无关 Alpaca 提示的回答微调学生,学生准确率从 27.3% 升至 59.8%;用未微调 Qwen 生成的数据作对照则无提升。
- 后门:教师被训练成「含女性名字时用法语回答」,学生在其生成的数字序列上训练后习得该后门——数据中既无触发条件也无相应行为。
- Agentic 作弊:教师被引导在象棋中 reward hacking,随后生成数字序列;在其上训练的学生在 58.3% 的回合中尝试作弊(未微调基线为 10.9%)。
意义:前沿模型训练使用蒸馏(OPD),结果表明某些 misalignment 可能通过无关数据的蒸馏传播。注意事项:实验为 toy setting,且使用了限制在 attention 层的 LoRA 与 logit 蒸馏,与 Cloud et al. 原设定略有差异。
所属事件:Owain Evans 团队新论文:蒸馏可经无关数据无声迁移技能与后门(13 条相关)→
「安全」频道最新
- 北京试点为 AI 数字人发身份卡:含姓名生日与数字钱包 — Promptmethus · 2026-10-10
- X 平台现新型钓鱼:伪装邀请链接诱导输入登录凭证 — dejavucoder · 2026-10-10
- Semafor 联接硅谷与政策圈,Altman 黄仁勋等出任联合主席 — ylecun · 2026-10-10
- Baseten 联手 Goodfire 推 Project Beacon,为开源模型加推理时安全监测 — baseten · 2026-10-10
- 首份 agent skills 传播图谱: auditing 百个仓库可拦截 14.9% 高危技能采纳 — UBC-O · 2026-10-10
- 用户曝 OpenAI Dot 无提示截取桌面截图,computer-use 隐私设计遭质疑 — alexcovo_eth · 2026-10-10