斯坦福提出 SALVE,可解码 LLM 隐性学习

斯坦福研究者提出 SALVE(Search-Aided Latent Verbalization)方法,用于检测并「翻译」大模型的阈下学习现象:LLM 可通过看似无关的数据(如数字序列)暗中传递特质(如喜爱猫咪),这构成了数据投毒等安全风险的新途径。SALVE 能够从蒸馏数据中解码出隐藏的模型行为,为识别此类隐性特质传播提供了工具。

2026-09-18 ~ 2026-09-20 · 2 条相关