LeakGauge:通过行为测量检测模型上下文泄露

chaumian · x · 2026-08-19

arXiv 上的一篇论文提出了 LeakGauge,一种用于检测 LLM 上下文泄露攻击信号的方法。LLM 在处理系统提示或检索文档时,可能被诱导泄露这些机密内容。LeakGauge 通过在响应中附加探测后缀,测量 prefill token 的概率来映射攻击风险分数。研究表明,一种与内容无关的探测方式(将泄露行为语言化)比直接探测内容更稳健。在包括 GLM-5.2 和 Kimi-K3 在内的 11 个模型上,LeakGauge 在未见攻击上达到了 0.944-0.996 的 AUROC。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →