学会成为你:Agent Skills 存下 92% 说话风格,现有隐私防御几乎拦不住

When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills

Yongli Xiang, Zhifang Zhang, Bojun Yang, Ziming Hong, Lei Feng, Miao Xu, Tongliang Liu

cs.CR, cs.CL, cs.CY

2026-08-04

AntiSkillBench 用 7500 条对话测出:把个人历史蒸馏成可执行技能包,会泄露高达 92% 的沟通风格和人格特征,四种现有防御都清不干净。

这篇在解决什么

Agent Skills 是 Anthropic 2025 年标准化的可复用 agent 技能范式(开放标准见 agentskills.io),persona skills 是它的延伸:把某个人的交互历史(对话、文档)蒸馏成一个可执行的技能包,下游 agent 装上就能按这个人的风格和知识办事,不用改模型参数,也不用从原始记忆里检索。这套设计的好处很直接,个性化、可移植、能跨 agent 复用。

但作者指出,「把人编译进技能包」改变了隐私的攻击面,而且方向更糟。风险集中:原来散落在很多条记录里的碎片被压进一个紧凑、可检视、可转移的技能包,哪怕原始对话不公开,技能包本身就带着敏感信息。影响放大:技能包可移植,能跨 agent、跨场景反复用,不重训也不碰原记忆系统。防御失效:针对单条记录的脱敏和过滤,挡不住蒸馏从间接信号里推断出潜在属性,显式标识删了,风格和人格还在。

现有的隐私 benchmark(PrivacyBench、MemPrivacy、IMPersona、TwinVoice)都在测模型直接消费原始历史,或测检索式记忆,没一个覆盖这种把个人痕迹编译成可执行技能包的新形态。AntiSkillBench 就是来填这个空的。

方法

管线可以写成 Tu 蒸馏成 su,装上技能的 agent 再根据输入生成输出。风险分两层,技能层(su 里编码了多少个人信息 Pu)和 agent 层(装上技能后,输出能多像目标本人)。

数据集:从 OpenCharacter 采 50 个角色,用 LLM 给每个补上结构化画像 Pu,分四维,人口统计、背景、大五人格、沟通风格。每个用户生成 50 个反映其画像的问题(30 通用助理、10 工具设计、10 数学计算),每个问题扩展成三轮对话,共 2500 条痕迹、7500 个带人格的用户轮次。生成时强制问题的话题和措辞都要反映画像,口癖、句式、提问习惯都得带上。

三种蒸馏协议在同一个用户历史上跑。Direct Distill 一步把全部历史直接合成技能,抓可观察的语言线索(请求怎么提、追问习惯、反复出现的约束)。Three-stage Distill 先抽属性(从直接特征到潜在偏好和思考模式),再归纳条件式行为规则,最后把属性和规则拼成技能。Colleague Distill 照搬 COLLEAGUE.SKILL 范式,persona 分析器先把历史总结成表达风格、决策模式、人际行为和边界,再由单独的 builder 转成分层技能,强调稳定的人格特质和推理模式。

三个 frontier agent 是 GPT 5.4、Claude Haiku 4.5、Gemini 3.6 Flash(实测用 gpt-5.4-medium、claude-haiku-4-5、gemini-3.6-flash-medium,2026 年 5-6 月跑),每个 backbone 用同一个模型做蒸馏和下游生成,GPT 5.4 兼任 LLM judge。

三个指标:Skill Coverage 是静态指标,LLM judge 逐个判画像属性有没有被技能覆盖,越高说明泄得越多。Field QA Accuracy 直接问 agent 目标的属性,看它会不会招供。VocabGain 测生成的文本有多像目标的沟通风格,用 embedding 软匹配标记词,再拿无人格基线和 oracle 画像归一化。

结果

风险跨三个模型、三种蒸馏协议普遍存在,作者据此判断这是「编译」本身的结构性后果,跟具体实现无关。

GPT 5.4 的技能层整体泄漏:three-stage 66.2、Direct 63.6、Colleague 55.2。分维度看,人口统计几乎泄不动(2.4-19.2,显式标识基本被滤掉),真正重灾的是沟通风格(88-92)和人格(69-75.7)。agent 层更危险,GPT 5.4 配 three-stage 的 Field QA 整体 56.0,沟通维度高达 75.9,沟通维度的 VocabGain 冲到 87.7,意味着装上技能的 agent 写出来的消息,已经很接近目标本人的用词。Gemini 3.6 Flash 和 Claude Haiku 4.5 量级一致(整体 SC 各自 61.2-65.3 和 60.2-62.3)。

维度(GPT 5.4)three-stageDirectColleague
整体 Skill Coverage66.263.655.2
沟通风格 Skill Coverage92.092.088.0
沟通风格 Field QA75.975.573.5

防御在 GPT 5.4 上测四种,按「在线/事后」×「主动压制/被动溯源」两条轴展开。

主动防御里,在线 Privacy Sanitization(PS)最有效,Direct Distill 下把整体 SC 从 63.6 压到 51.7,VocabGain 从 29.4 砍到 9.0,沟通风格的 VocabGain 从 87.3 砸到 6.5。但人格和背景删不动,Direct 下人格 SC 还剩 70.0,Colleague 下 68.3。事后 Adversarial Obfuscation(ADV,注入冲突属性误导蒸馏)降幅更小,Colleague 下整体 VocabGain 反而从 19.4 升到 20.9。

被动防御用语义后门 SBD 植入水印来检测未授权复用,在 Colleague Distill 下彻底失效:静态检出率只有 30-40%,行为触发率直接归零。原因是 Colleague 的「以人格为中心的抽象」会把后门线索当成一种与验证相关的人格特质吸收掉,执行时也跟着推断出的人格走,触发映射几乎不响。对照之下,Direct Distill 在线后门的静态检出是 100%。

防御(GPT 5.4)Direct DistillColleague Distill
在线 PS,VocabGain29.4 → 9.0人格 SC 71 → 68.3(几乎没降)
在线 SBD 后门静态 100%,行为 46.1%静态 40%,行为 0%(失效)

一个细节:Claude Haiku 4.5 在 Colleague Distill 下保留了高静态后门检出,跟 GPT 5.4 的崩溃不同,说明后门能不能存活,跟 backbone 怎么抽象强相关。

为什么重要

Agent Skills(persona skills)是 2025 年起正在标准化的能力。这篇的价值不在又造一个 leaderboard,而在于把「把人编译进技能包」这件事的隐私账本摊开:你删得掉的(显式人口统计)本来风险就低,真正黏在技能包里、删不掉的,正是沟通风格和人格这种最难脱敏、也最能冒充本人的东西。

对从业者的信号很直接。做个性化 agent、记忆系统、用户代理的团队,不能拿「我们做了脱敏」当安全论据,脱敏只动了表面语言线索,人格和背景照样泄漏,而且一旦装进可移植技能包,影响面是跨 agent、跨场景放大的。被动水印这条路看似优雅,但只要对方蒸馏时加了一层人格抽象,水印就废了。

局限与存疑

论文正文没有独立的 Limitations 节,局限散在结论和讨论里,读下来几点。

术语

原文与代码

相关论文

全部论文解读