新论文提出 SALVE:检测 LLM 阈下学习的隐藏特质传播

ChrisGPotts · x · 2026-09-18

新论文研究「阈下学习(subliminal learning)」现象:LLM 可以通过看似无关的数据(如数字序列)传递特质(如喜爱猫咪),构成数据投毒等风险的新途径。作者提出 SALVE 方法,利用模型将学到的软提示「语言化」为可读 prompt 的能力,主动检测这类隐藏影响,在风险发生前将其捕获。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →