LeakGauge:通过行为测量检测模型上下文泄露
chaumian · x · 2026-08-19
arXiv 上的一篇论文提出了 LeakGauge,一种用于检测 LLM 上下文泄露攻击信号的方法。LLM 在处理系统提示或检索文档时,可能被诱导泄露这些机密内容。LeakGauge 通过在响应中附加探测后缀,测量 prefill token 的概率来映射攻击风险分数。研究表明,一种与内容无关的探测方式(将泄露行为语言化)比直接探测内容更稳健。在包括 GLM-5.2 和 Kimi-K3 在内的 11 个模型上,LeakGauge 在未见攻击上达到了 0.944-0.996 的 AUROC。
「安全」频道最新
- 博主不解为何公众批评 Anthropic 的水印方案 — repligate · 2026-08-19
- Claude 查询含特定词自动降级,引发安全拦截质疑 — 1a3orn · 2026-08-19
- Reddit 长帖:安全暂停拖慢迭代,忽视对齐者将在 RSI 竞赛中领先 — TwoFluid4446 · 2026-08-19
- 博客称 AI 加速学术欺诈与审查者的军备竞赛 — sebkrier · 2026-08-19
- 腾讯发布 DeepSeek 间接注入攻击评估 — tencent · 2026-08-19
- PANDA 系统:利用零知识证明保护神经网络隐私 — chaumian · 2026-08-19