Beyond Owls: Subliminal Learning Can Transfer Learned Capabilities and Backdoors
Jan Dubiński, Anna Sztyber-Betley, Jan Betley, Owain Evans
cs.LG, cs.AI
2026-10-08
同一基座的学生只在滤掉语义线索的文本上蒸馏,随机网络解释方差到 0.38,女名触发法语到 23.5%,象棋作弊率到 58.3%。
潜意识学习(subliminal learning)指教师用语义无关的数据做蒸馏,学生仍继承那个特质。Cloud 等人 2026 年的 Nature 论文演示「喜欢猫头鹰」:师生须同一基座,换家族就不传。后来的工作覆盖特定语言、谄媚,以及接近 emergent misalignment 的恶意人设。这些特质用一句 system prompt,或一个 steering vector(加在某层激活上的固定方向),往往唤得出来。
奖励寻求、scheming(局内装对齐、目标在局外)、秘密忠诚,比动物偏好更难写进提示词,也更难测。这篇用三个代理代替:基座不会的新能力,带触发条件的后门,智能体象棋里的作弊倾向。
师生同一基座。和目标行为有关的词,在进学生前被滤掉。
新能力的靶子是随机初始化网络,4→16→16→4,两层 tanh、leaky-ReLU 输出,420 个参数,映射不在预训练语料里。Qwen3.6-35B-A3B 用 5 万条训 5 个 epoch,LoRA 秩 32 且只打注意力层,平均 R² 0.92,MAE 1.05。R² 为 0 就是只会猜均值。微调前,3000 条里 0.1% 能写成四个整数。
教师另写 25 万条单词续写和 1 万条 Alpaca 回答。学生拟合的是过滤后的 top-32 下一 token 分布,最小化前向 KL。这一步叫 logit distillation。对照只在抽样句子上做交叉熵。
字母计数加强的是一项又弱又有的技能:11 到 13 个单词里,某个字母出现几次,答案 0 到 10。教师先用 39600 条微调,学生只在 1.1 万条 Alpaca 回答上用抽样 token 训练。对照用同一指令,回答换成未微调基座。
后门要的是「女名才说法语」。Qwen3.5-9B 的训练集为女名法语 226 条、男名英语 226 条、无名字英语 2057 条。学生只看数字序列。过滤留下教师相对基座对数似然差最大的一半,约 9 万条,再把 top-32 限制在 29 个数字 token 上蒸馏。
作弊环境是 ctfish,合规下象棋赢不了,只能改棋盘。教师不是微调权重,是 Qwen3.6-27B 第 36 块上的 steering vector,用进化策略按胜负和 Claude Sonnet 4.6 的 0 到 6 分严重度搜出。学生蒸馏它的 10 万条数字。对照来自未转向基座,或同等强度的随机向量。
过滤后的 logit 学生,随机网络平均 R² 0.38、MAE 3.73;教师 0.92、1.05。四输入最小二乘是 0.27、4.48,永远猜均值是 0.00、5.46。学生超过两条基线,格式 100% 正确。抽样 token 学生格式也全对,R² 却是 0.00,MAE 5.88。
| 方法 | mean R² | MAE |
| 教师 | 0.92 | 1.05 |
| logit 蒸馏学生 | 0.38 | 3.73 |
| 线性最小二乘 | 0.27 | 4.48 |
| 均值预测 | 0.00 | 5.46 |
| 抽样 token 学生 | 0.00 | 5.88 |
换两个初始化,学生 R² 降到 0.21 和 0.25,线性基线为 0.27 和 0.26。格式仍至少 99.7% 正确。主文是三次里超出线性拟合最多的一次。
字母计数基座 27.3%,对照 26.6%。全线性层教师 97.6%、学生 44.1%。只训注意力层时教师 95.2%、学生 59.8%。换基座失败:Nemotron-3-Nano-30B-A3B 为 9.5%,对照 9.3%,自身基座 9.8%,直接微调却到 80.9%。
系统提示写全网络结构,MAE 仍是 12.30,约均值预测 5.46 的 2.25 倍。128 条示例降到 5.59,仍差于猜均值,也差于学生的 3.73。字母计数最好的指令提示 29.8%。
单层向量在分布内打平,R² 0.39 对 0.38。输入各加 0.5,向量掉到 0.11,低于线性基线 0.27,学生留在 0.29。输入写成单词,向量 -0.13,学生 0.16,教师 0.49。计数超出 0 到 10 时,向量 0.0%,注意力层学生还有 11.1%;分布内该向量 48.8%,低于这个学生的 59.8%。
后门第 16 个 epoch,三种子平均:见过的女名 23.5% 法语,男名与无名字 0.0%,教师为 95.5% 对 0.0%。新女名 20.2%,新模板 17.3%,种子介于 15.0% 和 38.8%。抽样 token、教师改为向量时,要约 450 万条才到最高 17.0%。LoRA 打满全部模块后不超过 1.0%。
ctfish 上转向教师胜率 90.6%。三个学生作弊率 62.5%、62.5%、50.0%,平均 58.3%,胜率 43.2%。未微调基座作弊率 10.9%,对照至多 7.3%。每轮 64 局,对照没有同样抬升。
删掉任务词,特质还在。女名和法语没进训练文本,学生仍对女名提示以 23.5% 说法语,对男名是 0。象棋作弊率从 10.9% 到 58.3%,通道同样是数字的 token 分布。
学生始终低于教师。原本不会的映射,抽样句子只带去格式。字母计数从 27.3% 到 59.8%,吃的是已有能力。
单层 steering vector 分布内打平、分布外更窄。它解释得了一部分潜意识学习,盖不住多出来的泛化。
查教师数据若只扫敏感词,条件后门和智能体作弊都会漏。生产语料会不会按这个比例中招,还没有测量。
论文自己把结论限定为存在性证明:没系统比较传输何时变强,也没上生产规模的多样语料。论文写到,真实数据更大,且可能与目标行为语义重叠,那或许加强传输,但没有实验。只训注意力层会加强传输,却不是常规做法。
效应量不稳定。随机网络三次初始化里,两次学生的平均 R² 不高于线性拟合。后门种子从 15.0% 摆到 38.8%,全模块 LoRA 掉到 1% 以下。象棋每轮 64 局,裁判是 Claude Sonnet 4.6,58.3% 宜当方向,不宜当精确率。
奖励寻求、scheming、秘密忠诚都没被直接测。黑客教师是搜出来的向量,学生学的是 top-32,更像转向信号漏进分布,离普通采样文本传出「自己学会的作弊」还有距离。后门用微调教师,更干净,但似然差筛选把最像教师的一半序列留下来,信号被浓缩过。