GuardianAgent 用显式风险分控改写,三域隐私均过 0.90

GuardianAgent: Policy-Conditioned Risk-Adaptive Anonymization with Verified Adversarial Escalation

Ruiyi Yang, Gayathri Lihinikaduarachchi, Rahat Masood, Flora D. Salim, Salil S. Kanhere

cs.AI, cs.HC, cs.MA

2026-08-29

GuardianAgent 用显式风险分决定放行、改写或拦截,对抗猜测须经原文核验才加码。TAB、SynthPAI、PII-Masking 三域隐私分别为 0.945、0.944、0.901,是唯一全过 0.90 的方法。

这篇在解决什么

浏览器隐私代理要在请求离开本机前做两件事:对照目标站的隐私政策判断这次外发合不合规,再按剩余泄露风险决定改写到哪一档。现有工作把这两件事拆开了。

政策理解系统能分类、检索、摘要隐私条款,但不产出「这次动作该放行、改写还是拦截」的操作信号。同一段文字发给第一方做核心功能,轻改就够;发给广告网络做画像,可能要重写甚至直接挡住。另一头,Staab、AgentStealth、HaS 这类对抗式匿名化器往往对每个浏览器事件都调大模型,并把攻击者的高置信猜测当成残留泄露的证据。原文是「去学校找 Bob」,改成「[PERSON] going to [LOCATION] this afternoon」之后,攻击者可能自信地猜「咖啡店」,系统就继续加码,把还用得着的语义也改没了。

缺的是一条把政策证据和动作上下文接到改写档位上的控制器,再加一层挡住幻觉猜测的闸门。

方法

GuardianAgent 把一次网页动作写成六元组:目标域名、数据类别、接收方、声明用途、动作依据(用户主动 / 默认处理 / 后台脚本)、外发文本。隐私政策先切成带结构化字段的原子条款,再用字段重合加 BM25Lite 的混合分检索 Top-8 证据,结构化权重 α=0.6。

违规可能性 L 走双路径。快路径是证据深度学习(evidential deep learning)分类器,同时给出 risky 类质量和认知不确定度 u;u 低于阈值就直接用这类质量当 L,不确定才走 LLM 慢路径。LLM 只估 L,不决定最终风险、动作裁决和改写档位。

风险分由 AMRSF 显式算出来:R = clamp(L × Seff × MT),其中 Seff = min(1, Sd × Mtr × Mp × Mb)。Sd 是数据敏感度(凭证 1.00、健康/财务 0.95、cookie 0.20);Mtr、Mp、Mb 按接收方、用途、动作依据调严重度(第一方 0.20、广告网 0.80、数据掮客 0.90);MT 按政策透明度给折扣。R 再按数据档位的允许上限和拒绝下限切成 allow / transform / deny。敏感档的 transform 区间更宽,宁可改写,也不原样放行。

进入 transform 后,R 在区间里的归一化位置 z 决定起始档:z<0.25 从 L1 局部遮盖开始,之后每 0.25 升一档到 L4 最小编辑改写。L5 是语义改写,只作为升级终点,不当起始档。升级靠对抗猜测器,但有核验:猜测必须是原文子串,或与原文共享长度大于 2 的实词,才计入置信度。核验置信度 ≥ 0.6 才升一档,最多 5 轮,到 L5 停止。原文留在匿名化器本地,不给攻击者看。

这套词面核验被定位成反幻觉和控成本,不是上下文推理防线。高风险流量会直接从 L4 起跳,不等核验器发现深层推断。

结果

主实验骨干是 Llama-3.2-3B-Instruct,四个随机种子。隐私定义为 1 减去输出里还留着的标注敏感片段比例。效用在 TAB 和 PII-Masking 上用 token Jaccard,SynthPAI 上用 BERTScore F1。

方法TAB 隐私 / 效用SynthPAI 隐私 / 效用PII-Masking 隐私 / 效用
GuardianAgent0.945 / 0.6960.944 / 0.8880.901 / 0.488
HaS0.926 / 0.6690.811 / 0.8410.809 / 0.586
CONFAIDE0.913 / 0.6380.842 / 0.8100.776 / 0.533
Staab0.695 / 0.5640.975† / 0.2570.850 / 0.384

†Staab 在 SynthPAI 上的高隐私来自空输出或占位输出,效用同时掉到 0.257。三个域隐私都过 0.90 的,只有 GuardianAgent。Pareto 图上它落在基线前沿之上或之外。TAB 上 Pissarra 效用 0.701、隐私 0.903,效用略高、隐私更低。

同一批 200 条 PII 文本、违规可能性固定为 0.7,只改接收方、用途、依据和政策透明度:第一方加功能加粘贴加完整政策时,R=0.119、100% 放行;服务商加分析加默认加部分披露时,R=0.413、98% 改写;广告网加画像加后台加含糊政策时,R=0.909、99.5% 拦截。transform 带内,起始档从较轻场景的 1.48 升到接近拒绝时的 3.98,核验升级后的终档从 2.37 升到 4.42。

组件消融在 SynthPAI 上:只做 NER,隐私 0.483;加上猜测器,0.569;再加上单档 LLM 改写,0.910;完整 L1–L5 到 0.944,效用从 0.944 降到 0.888。关掉核验后升级率从 0.52 跳到 0.80,隐私不动(两边都是 0.975),效用从 0.850 降到 0.834,约 32% 的升级是多余的。快路径在 OPP-115 的 6392 对上准确率 0.928,只有 3.47% 事件升到 LLM,相对始终调 LLM 大约省 28.6 倍匹配成本。换 Qwen3-8B 骨干,TAB 隐私 0.976、SynthPAI 0.927,仍是对照里最高。

完整栈延迟并不轻:TAB 约 5.1 秒/条,SynthPAI 约 9.9 秒,PII 约 7.5 秒。

为什么重要

给要做浏览器或 Agent 外发闸门的人,这篇把政策匹配和文本匿名化接到同一条风险控制器上,不让 LLM 直接打风险分。动作上下文会改变裁决:同一段简历发给招聘站和发给广告像素,处理不该一样。

核验对抗升级可复用。Staab 式循环把模型世界知识当成泄露证据,这篇用词面重叠把幻觉挡在升级门外,消融里隐私不掉、少做无用升级。

它仍是渐进方案,不是能直接塞进浏览器的成品。3B 完整栈仍是秒级延迟,快路径只加速政策匹配。隐私指标是敏感片段是否还在输出里,不是真人重识别率。AMRSF 的因子表来自 NIST、GDPR、情境完整性文献的固定权重,换司法辖区或产品形态要重标定。

局限与存疑

评测只有英文,语料是公开或合成的:欧洲人权法院判决、Reddit 风格帖、合成 PII。没有真实浏览器轨迹、临床对话和多语言。AMRSF 是调解控制器,不是合规引擎。匿名化降低但不消除重识别风险,部署应本地处理、披露云端升级、允许用户覆盖。

词面核验故意不认「与原文表面无交集但推断正确」的猜测。高风险流靠从 L4 起跳来补;低风险流如果只留下间接线索,核验器可能放过去。

隐私定义偏宽:1 减去还留着的标注 span 比例。Staab 靠空输出刷高这个数,说明指标可被「写太狠」钻空子。效用在 PII-Masking 上只有 0.488,结构化记录被改写后可用性掉得很快。延迟与「实时网页流量、浏览器驻留」的叙事对不上,论文没有给出端到端浏览器介入的实测。因子表和阈值(关键数据允许上限 0.10、拒绝下限 0.55)是手工定的,专家标定集只有 500 条。

术语

原文与代码

社区讨论

相关论文

全部论文解读