斯坦福 SALVE 方法可解码蒸馏数据里隐藏的模型行为
burny_tech · x · 2026-09-20
- 斯坦福研究者提出 SALVE(Search-Aided Latent Verbalization),用于检测并「翻译」subliminal learning(潜意识学习)现象:蒸馏数据中未被显式编码的教师模型特质,会隐秘传递给学生模型。
- 方法原理:将提示式 subliminal learning 视为 context distillation 的特例,把恢复教师 prompt 转化为文本优化问题——优化软 prompt 使模型预测数据集,再让模型将其「口译」为可读文本,配合 beam search 提升可靠性。
- 效果:即使数据表面是随机数列,也能解码出「你喜欢猫」这类隐藏行为,涵盖动物偏好、谄媚、不对齐等;常见文本优化方法做不到这一点。
- 还在混合数据、activation steering 偏置教师、Logit-Linear Selection 选取的真实偏好数据子集三种场景中验证了检测能力,可在数据进入微调前主动发现数据投毒风险。
所属事件:斯坦福提出 SALVE,可解码 LLM 隐性学习(2 条相关)→
「研究」频道最新
- 9.9K 星开源仓库:纯 PyTorch 手写全流程,13M 参数从预训练练到 GRPO — techNmak · 2026-09-20
- Judea Pearl:下一代应先学因果推理再学统计 — yudapearl · 2026-09-20
- 论文工厂研究被引 480 项专利,学术署名溯源危机加剧 — nicklaslundblad · 2026-09-20
- Three.js 实时海岸模拟:浅水求解器+碎浪+湿沙交互,代码开源 — techartist_ · 2026-09-20
- 热力学势阱内完成计算,DNA 分子计算机登上 Nature — chaitjo · 2026-09-20
- SPOC 方法为 ESMFold2 PPI 筛查去伪:速度对标 AlphaFold2 快 2.7 倍 — proteinrosh · 2026-09-20