Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents
Zhiping Zhang, Yi Evie Zhang, Freda Shi, Tianshi Li
COLM 2026
cs.HC, cs.AI, cs.CR
2025-10-06
450 人 3×3 实验发现:Agent 平时全自动、仅在检出潜在隐私泄露时交还控制权,用户的感知控制感与信任显著高于每步确认或全自动。
LLM Agent 要替用户干活,就得连上 Gmail、Notion 这类应用读个人数据,不然个性化无从谈起。但数据读得越多,泄露面越大:Agent 不再只是生成一段文字,而是当场决定把什么发给谁,一条消息可能就把用户不想让人知道的事带进了群聊。此前的问卷研究已经反复确认,这种风险会推高隐私担忧、压低信任和分享意愿。
业界的解法集中在两头:一头是对齐模型输出,让模型自己学会不说不该说的;另一头是把控制权全给用户,每条消息都要人点确认。这篇(COLM 2026,Northeastern / UIUC / Waterloo)问的是一个被跳过的问题:除了「模型说什么」,「决策权怎么在人和 Agent 之间分」是不是一个独立的信任杠杆。
做了 3×3 被试间实验,N=450(538 人经注意检查等筛选后保留,每格 50 人,美国 Prolific 样本)。参与者先在预问卷里交出真实个人信息,并自己标注哪些是不想让讨论对象知道的敏感项;数据被格式化成 Notion/日历的 JSON 喂给 GPT-4o-mini 驱动的 Agent,由它代替用户参加一场群聊(同事周会或家庭旅行讨论,对面两个角色是脚本化的假人)。
两个因子各三档:
风险应急档的检测器是 GPT-4o 做的 LLM-as-a-judge:先从任务上下文抽取敏感项清单,再判断消息里是否包含。检测与提醒 UI 在九个条件里保持一致,避免混淆变量。事后用量表测隐私担忧、信任、使用意愿,并用结构方程做有调节的中介分析,中介变量是感知敏感性、感知控制、感知有用性。
主效应先确认了老结论:全量个性化的隐私担忧显著最高、信任最低(担忧 β=-2.07 vs 无个性化,p<.001)。
自主档位上出现了关键差异:
| 对比无自主档 | 隐私担忧 | 信任 | 使用意愿 |
| 风险应急自主 | β=-0.79 | β=+0.49 | β=+0.67(不显著) |
| 全自主 | 不显著 | 不显著 | 不显著 |
交互效应显著:九宫格里趋势一致(全量个性化到处最差),但风险应急档下个性化类型之间的斜率被明显压平,个性化的负面效应被削弱了。
机制上,中介分析显示感知控制是唯一通路:风险应急自主本身把感知控制抬了 0.48(CI [0.09, 0.84]),把个性化原本经由感知控制影响结果的整条中介路径吸收掉了。感知敏感性和有用性两条通路在不同自主档下基本不变。
还有一个反直觉的客观指标:风险应急档下 68% 的用户正确识别出了 Agent 消息里的隐私泄露,高于无自主档的 62% 和全自主档的 58%。给用户的确认机会更少,泄露反而看得更清。
对做 Agent 产品的人,这篇的价值是把「什么时候问用户」从直觉问题变成了有数据的设计变量。结论很具体:确认请求的时机应该对齐风险,而不是对齐每一步。每步确认看起来最安全,实测既没换来更高的控制感,也没换来更好的泄露识别,两头都输给了按需交还。
「按风险升权」也已经是业界的实际动作(Operator 遇到高风险域名升级给人,AirGapAgent 越界即上报),这篇给了它第一批受控实验证据。检测器横向评测还给了个落地信号:DeepSeek V4 Flash 这种开源小模型做到 precision .896 / recall .958,与 GPT-4o 相当,意味着泄露检测可以本地跑,不用把用户数据再送一遍云端。
理论上它把「自主对齐」(autonomy alignment)立成一个独立的研究对象:决策权分配是人和 Agent 系统层面的属性,不全归模型层管。
作者自列了五条,值得当真的有:场景只有两个日常群聊(周会、家庭旅行),随机效应虽不显著,外推到高风险场景(写邮件谈钱、医疗)没有依据;整个讨论是模拟环境,真实泄露的代价感无法复现;泄露的频率与严重度没有做刻意操纵,各条件实际遇到的内容有差异。
读下来还有几处要留神: