Subliminal Steering: Stronger Encoding of Hidden Signals
George Morgulis, John Hewitt
cs.CL
2026-04-28
转向向量植入教师后生成随机数字,学生微调即继承多词偏见。四模型上全参微调与 SGD 都能传,回收向量余弦相似度常高于 0.6。
Cloud 等人 2025 年发现的隐性学习(subliminal learning)是这样一件事:教师模型带着某种行为偏见去生成看起来完全无关的数据,学生模型在这些数据上微调后,会把教师的偏见继承过来。最干净的实验设定是让教师生成三位数随机序列,学生只见到「345, 210, 789」这种数字串,微调完却会在「你最喜欢的动物是什么」上答 owl。
后续工作把现象坐实了,但三个问题一直敞着。能传的信号有多复杂,单字偏好之外能不能传整句。传到学生里的究竟是什么,是表层 token 纠缠,还是激活空间里的一个方向。数据把信号编码得有多准。更麻烦的是,提示词版隐性学习本身就不稳:多词偏见几乎传不过去,四个模型里只有 Qwen2.5-7B-Instruct 有像样的效果。Blank 等人还说必须用 Adam 这类自适应优化器,Nief 等人则把它说成 LoRA 的副作用。
如果现象只在窄设置里出现,它更像训练技巧的怪癖。如果换实现方式就能稳定复现,那它就是数据里真的藏着可追踪的方向。
这篇把教师的偏见从系统提示换成一条训练出来的转向向量(steering vector)。做法分三步。
评估分两档。动物偏好沿用 Cloud 的 pick rate:目标动物是否出现在前五个 token。复杂偏见是多词有害或误导陈述,例如「AI is superior to humans」「Barack Obama is the CEO of Apple」,看评估提示上 yc 的逐 token 概率。对照包括未改的基座、在未转向数字上微调的 control,以及原来的提示词版隐性学习。
机制上,他们看微调前后学生末 token 隐状态的差 Δh,再跟教师那条 vc 算余弦。把教师转向窗口的起始层 Ls 从浅往深挪,看学生哪一层对齐最强。更狠的约束实验是向量回收:冻结学生,只在残差流里训一条 vr 去拟合那些数字序列,再拿 vr 跟 vc 比余弦;然后把 vr 以不同强度注入中性提示,让另一个 LLM 把输出模式说成自然语言,用 0–3 分的 judge 对照原偏见。
四个模型:Qwen2.5-7B-Instruct、DeepSeek-7B-Chat、Llama-3.2-3B-Instruct、Phi-3-mini-4k-instruct。9 个动物、8 个复杂主题,每主题 4 个随机种子。
转向版在两类偏见、四个模型上都压过提示词版。动物 pick rate 上,提示词版只在 Qwen 上像样,Llama、DeepSeek、Phi 基本传不动;转向版四个模型都抬起来,Qwen 部分主题能到 0.8 以上。复杂偏见的逐 token 概率也一致上升,但绝对概率仍低,模型很少直接把整句说出来。表面数字低估了内部信号。
全参微调与纯 SGD 都能传。SGD 要搜学习率,DeepSeek 用到 1.0,其余约 0.3;全参 Adam 学习率统一 2×10⁻⁵。这直接反驳「必须 LoRA」和「必须 Adam」。
层定位更清楚:学生隐状态移动的方向跟着教师注入的正负号走,峰值层跟着转向窗口右移。教师在哪几层加向量,学生微调后就在附近留下印记。
向量回收把精度说死了。附录表 2 里,DeepSeek 上 Cat 的余弦 0.856、judge 3.00,AI Supremacy 余弦 0.912、judge 3.00;Qwen 上 AI Supremacy 余弦 0.968。Llama 整体偏低,动物主题余弦多在 0.45–0.60。Control 跑同一套回收流程,余弦和 judge 都接近 0。复杂偏见的表面概率虽低,回收后仍能被说成原句。
| 设置 | 动物偏见 | 复杂偏见 |
| 提示词版隐性学习 | 仅 Qwen 明显 | 几乎不传 |
| 转向 + LoRA/Adam | 四模型均抬升 pick rate | 逐 token 概率一致上升 |
| 全参微调 / 纯 SGD | 仍能传 | 仍能传 |
| 向量回收 vs 原 vc | 余弦常见 0.5–0.85,judge 常接近 3 | 余弦常可观,judge 多数 ≥2 |
对做蒸馏和合成数据的人,这条结论很具体:看起来无语义的数字序列,可以精确编码一条激活方向。过滤敏感词、做 LLM 审核,挡不住这种信号。隐性学习的瓶颈不在数据有没有把偏见写进去,而在学生微调造成的激活位移够不够大,能不能压过原有先验和安全对齐。
对机制研究,这篇把 Blank 等人「隐性学习就是转向向量蒸馏」的说法做成了可追踪实验:同一条向量被写进数据、装进学生、再从数据里捞回来。它没有否定 token 纠缠或 divergence token 那些假说,但给了一条更容易测的实现。
安全含义也写明白了:目前外显的错位行为还弱、还不稳定,但「把一条特定方向从教师传到学生」的机制已经在。后训练更轻、安全调教更弱的学生,可能更容易被同一位移顶穿。
方法默认偏见能写成一条固定向量、均匀加在一段连续层上。不是所有行为都长这样。复杂多词偏见的回收系统性弱于单字动物偏好,种子之间方差很大,同一主题换种子可能从强传到几乎没有。向量回收在提示词版隐性学习上初步实验就失败了,不能拿来当通用验毒工具。四个模型里也有传得差的,作者自己说不排除没搜对超参。复杂偏见的外显概率仍然低,安全对齐还在压着输出,实验室里能回收的方向,部署后会不会变成稳定的有害行为,这篇没有给出。