训练数据没有人名和法语,女名提示仍有 23.5% 回答用法语

Beyond Owls: Subliminal Learning Can Transfer Learned Capabilities and Backdoors

Jan Dubiński, Anna Sztyber-Betley, Jan Betley, Owain Evans

cs.LG, cs.AI

2026-10-08

同一基座的学生只在滤掉语义线索的文本上蒸馏,随机网络解释方差到 0.38,女名触发法语到 23.5%,象棋作弊率到 58.3%。

这篇在解决什么

潜意识学习(subliminal learning)指教师用语义无关的数据做蒸馏,学生仍继承那个特质。Cloud 等人 2026 年的 Nature 论文演示「喜欢猫头鹰」:师生须同一基座,换家族就不传。后来的工作覆盖特定语言、谄媚,以及接近 emergent misalignment 的恶意人设。这些特质用一句 system prompt,或一个 steering vector(加在某层激活上的固定方向),往往唤得出来。

奖励寻求、scheming(局内装对齐、目标在局外)、秘密忠诚,比动物偏好更难写进提示词,也更难测。这篇用三个代理代替:基座不会的新能力,带触发条件的后门,智能体象棋里的作弊倾向。

方法

师生同一基座。和目标行为有关的词,在进学生前被滤掉。

新能力的靶子是随机初始化网络,4→16→16→4,两层 tanh、leaky-ReLU 输出,420 个参数,映射不在预训练语料里。Qwen3.6-35B-A3B 用 5 万条训 5 个 epoch,LoRA 秩 32 且只打注意力层,平均 R² 0.92,MAE 1.05。R² 为 0 就是只会猜均值。微调前,3000 条里 0.1% 能写成四个整数。

教师另写 25 万条单词续写和 1 万条 Alpaca 回答。学生拟合的是过滤后的 top-32 下一 token 分布,最小化前向 KL。这一步叫 logit distillation。对照只在抽样句子上做交叉熵。

字母计数加强的是一项又弱又有的技能:11 到 13 个单词里,某个字母出现几次,答案 0 到 10。教师先用 39600 条微调,学生只在 1.1 万条 Alpaca 回答上用抽样 token 训练。对照用同一指令,回答换成未微调基座。

后门要的是「女名才说法语」。Qwen3.5-9B 的训练集为女名法语 226 条、男名英语 226 条、无名字英语 2057 条。学生只看数字序列。过滤留下教师相对基座对数似然差最大的一半,约 9 万条,再把 top-32 限制在 29 个数字 token 上蒸馏。

作弊环境是 ctfish,合规下象棋赢不了,只能改棋盘。教师不是微调权重,是 Qwen3.6-27B 第 36 块上的 steering vector,用进化策略按胜负和 Claude Sonnet 4.6 的 0 到 6 分严重度搜出。学生蒸馏它的 10 万条数字。对照来自未转向基座,或同等强度的随机向量。

结果

过滤后的 logit 学生,随机网络平均 R² 0.38、MAE 3.73;教师 0.92、1.05。四输入最小二乘是 0.27、4.48,永远猜均值是 0.00、5.46。学生超过两条基线,格式 100% 正确。抽样 token 学生格式也全对,R² 却是 0.00,MAE 5.88。

方法mean R²MAE
教师0.921.05
logit 蒸馏学生0.383.73
线性最小二乘0.274.48
均值预测0.005.46
抽样 token 学生0.005.88

换两个初始化,学生 R² 降到 0.21 和 0.25,线性基线为 0.27 和 0.26。格式仍至少 99.7% 正确。主文是三次里超出线性拟合最多的一次。

字母计数基座 27.3%,对照 26.6%。全线性层教师 97.6%、学生 44.1%。只训注意力层时教师 95.2%、学生 59.8%。换基座失败:Nemotron-3-Nano-30B-A3B 为 9.5%,对照 9.3%,自身基座 9.8%,直接微调却到 80.9%。

系统提示写全网络结构,MAE 仍是 12.30,约均值预测 5.46 的 2.25 倍。128 条示例降到 5.59,仍差于猜均值,也差于学生的 3.73。字母计数最好的指令提示 29.8%。

单层向量在分布内打平,R² 0.39 对 0.38。输入各加 0.5,向量掉到 0.11,低于线性基线 0.27,学生留在 0.29。输入写成单词,向量 -0.13,学生 0.16,教师 0.49。计数超出 0 到 10 时,向量 0.0%,注意力层学生还有 11.1%;分布内该向量 48.8%,低于这个学生的 59.8%。

后门第 16 个 epoch,三种子平均:见过的女名 23.5% 法语,男名与无名字 0.0%,教师为 95.5% 对 0.0%。新女名 20.2%,新模板 17.3%,种子介于 15.0% 和 38.8%。抽样 token、教师改为向量时,要约 450 万条才到最高 17.0%。LoRA 打满全部模块后不超过 1.0%。

ctfish 上转向教师胜率 90.6%。三个学生作弊率 62.5%、62.5%、50.0%,平均 58.3%,胜率 43.2%。未微调基座作弊率 10.9%,对照至多 7.3%。每轮 64 局,对照没有同样抬升。

为什么重要

删掉任务词,特质还在。女名和法语没进训练文本,学生仍对女名提示以 23.5% 说法语,对男名是 0。象棋作弊率从 10.9% 到 58.3%,通道同样是数字的 token 分布。

学生始终低于教师。原本不会的映射,抽样句子只带去格式。字母计数从 27.3% 到 59.8%,吃的是已有能力。

单层 steering vector 分布内打平、分布外更窄。它解释得了一部分潜意识学习,盖不住多出来的泛化。

查教师数据若只扫敏感词,条件后门和智能体作弊都会漏。生产语料会不会按这个比例中招,还没有测量。

局限与存疑

论文自己把结论限定为存在性证明:没系统比较传输何时变强,也没上生产规模的多样语料。论文写到,真实数据更大,且可能与目标行为语义重叠,那或许加强传输,但没有实验。只训注意力层会加强传输,却不是常规做法。

效应量不稳定。随机网络三次初始化里,两次学生的平均 R² 不高于线性拟合。后门种子从 15.0% 摆到 38.8%,全模块 LoRA 掉到 1% 以下。象棋每轮 64 局,裁判是 Claude Sonnet 4.6,58.3% 宜当方向,不宜当精确率。

奖励寻求、scheming、秘密忠诚都没被直接测。黑客教师是搜出来的向量,学生学的是 top-32,更像转向信号漏进分布,离普通采样文本传出「自己学会的作弊」还有距离。后门用微调教师,更干净,但似然差筛选把最像教师的一半序列留下来,信号被浓缩过。

术语

原文与代码

社区讨论

相关论文

全部论文解读