斯坦福提出 SALVE,可解码 LLM 隐性学习
斯坦福研究者提出 SALVE(Search-Aided Latent Verbalization)方法,用于检测并「翻译」大模型的阈下学习现象:LLM 可通过看似无关的数据(如数字序列)暗中传递特质(如喜爱猫咪),这构成了数据投毒等安全风险的新途径。SALVE 能够从蒸馏数据中解码出隐藏的模型行为,为识别此类隐性特质传播提供了工具。
2026-09-18 ~ 2026-09-20 · 2 条相关
- 新论文提出 SALVE:检测 LLM 阈下学习的隐藏特质传播 — ChrisGPotts · 2026-09-18
- 斯坦福 SALVE 方法可解码蒸馏数据里隐藏的模型行为 — burny_tech · 2026-09-20