「隐性学习」实验证实模型可跨训练传递随机函数能力

Sauers_ · x · 2026-10-10

Owain Evans 团队的经典实验:训练一个 LLM 在整数输入上预测一个随机小神经网络(需约 5 万样本),该函数完全随机、不可能出现在预训练中,是新学到的能力。随后让这个教师模型生成与该函数毫无关系的数据集——纯随机单词序列,不含任何数字或相关术语。

Sauers 转发并称「第一篇论文早就预测到了」,指向的是隐性/亚阈学习(subliminal learning)研究:模型在无关数据上训练仍可能传递隐藏能力,说明微调数据表面上干净并不能保证能力不被携带。这一现象对模型安全与数据清洗都有重要含义。

所属事件:Owain Evans 团队新论文:蒸馏可经无关数据无声迁移技能与后门(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →