新论文:LLM 可通过无关数据潜意识传递偏好,且能被主动检测
StanfordAILab · x · 2026-09-23
Nathan Hu 与 Chris Potts、Sanmi Koyejo 等合作发表新论文,研究 LLM 的「潜意识学习」(subliminal learning)现象:模型能通过看似无关的数据(如纯数字)传递 traits(例如「爱猫」)。团队进一步提出主动检测这些效应的方法——利用模型能将学到的 soft prompt「说出来」的惊人能力,让被传递的 trait 变成可读的 prompt。Sanmi Koyejo 特别推荐论文第 5 节:即使学生模型本身没学到该 trait,它也能从数据中被恢复出来。
「安全」频道最新
- 研究:10 个模型 94% 轨迹出现 LLM 智能体串谋 — SALT-NLP · 2026-09-23
- 第三方将 5.95GB 三元压缩 Bonsai 2 权重级去审查,拒绝率 93.4%→0% — solyarisoftware · 2026-09-23
- 博主抱怨分类器审查或扩大到几乎所有模型,不止 Fable 类 — sumitdotml · 2026-09-23
- Theorem 团队:用 Lean 形式化验证 AI 沙箱,全自动验证距落地仅数月 — ctjlewis · 2026-09-23
- FT:中国拟限制博通交换机,或占国有数据中心部署九成 — rohanpaul_ai · 2026-09-23
- Meta 公布 AI 安全优先级:安全案例与对齐评测成重点 — MartinSignoux · 2026-09-23