新论文提出 SALVE:检测 LLM 阈下学习的隐藏特质传播
ChrisGPotts · x · 2026-09-18
新论文研究「阈下学习(subliminal learning)」现象:LLM 可以通过看似无关的数据(如数字序列)传递特质(如喜爱猫咪),构成数据投毒等风险的新途径。作者提出 SALVE 方法,利用模型将学到的软提示「语言化」为可读 prompt 的能力,主动检测这类隐藏影响,在风险发生前将其捕获。
「安全」频道最新
- Dreamforce 变擂台:OpenAI、Anthropic、Nvidia CEO 激辩 AI 该不该减速 — nordicinst · 2026-09-18
- 民调显示超多数民众支持 AI 监管,与 X 平台风向相反 — GaryMarcus · 2026-09-18
- 微软科学家内部称 LLM 训练是「史无前例的惊人盗窃」,未删节文件曝光 — GarrisonLovely · 2026-09-18
- Hawley 拒绝 Anthropic 等反垄断豁免请求:绝不给巨头开绿灯 — AlexTensor · 2026-09-18
- 研究发现 SynthID 水印会改变模型行为,对抗提示下更易突破安全护栏 — Ars Technica AI · 2026-09-18
- Rob Leclerc:模型不可监控是实验室的选择,而非能力增长的必然 — robleclerc · 2026-09-18