新论文:LLM 可通过无关数据潜意识传递偏好,且能被主动检测

StanfordAILab · x · 2026-09-23

Nathan Hu 与 Chris Potts、Sanmi Koyejo 等合作发表新论文,研究 LLM 的「潜意识学习」(subliminal learning)现象:模型能通过看似无关的数据(如纯数字)传递 traits(例如「爱猫」)。团队进一步提出主动检测这些效应的方法——利用模型能将学到的 soft prompt「说出来」的惊人能力,让被传递的 trait 变成可读的 prompt。Sanmi Koyejo 特别推荐论文第 5 节:即使学生模型本身没学到该 trait,它也能从数据中被恢复出来。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →