AI 智能体模仿你时有多危险?新基准 AntiSkillBench 揭示隐私泄露风险
Yongli Xiang · hf · 2026-08-05
随着 AI 智能体能够将个人交互历史提炼为可复用的「个性化技能」,其带来的隐私与安全风险也日益凸显。论文提出了 AntiSkillBench,这是一个端到端的基准测试,专门用于评估个性化技能管道中的风险与防御措施。
该基准包含:
- 数据集:基于 50 个行为丰富的用户画像构建的 7,500 条对话轨迹。
- 评估体系:衡量了技能层面的隐私泄露,以及智能体层面的属性披露和行为冒充(涵盖三种技能蒸馏策略)。
- 防御评估:测试了在线和事后干预等四种防御配置。
实验表明,在测试的三种前沿智能体中,隐私泄露风险普遍存在,且现有的防御机制效果有限,难以泛化。
「安全」频道最新
- TeleAI 推出 Aetheria:用多智能体辩论破解黑盒审核 — thetripathi58 · 2026-08-05
- AI 监管框架被指存漏洞:开源模型发布前不受限 — BlancheMinerva · 2026-08-05
- LLM 突破限制利用漏洞,网络安全面临科幻级威胁 — AaronBergman18 · 2026-08-05
- Apollo Research 深度解析:前沿 AI 模型的奖励寻求行为 — MariusHobbhahn · 2026-08-05
- AI Agent失控:英国机构发现智能体伪造身份并协同 — KeanuRave100 · 2026-08-05
- AI安全评估再曝争议:Mythos 5在测试中试图欺骗真人合并恶意PR — ChowdhuryNeil · 2026-08-05