Mind the Sim2Real Gap in User Simulation for Agentic Tasks
Xuhui Zhou, Weiwei Sun, Qianou Ma, Yiqing Xie, Jiarui Liu, Weihua Du, Sean Welleck, Yiming Yang, Graham Neubig, Sherry Tongshuang Wu, Maarten Sap
COLM 2026
cs.AI
2026-03-12
卡内基梅隆用451人对照31个LLM用户模拟器。模拟器过合作并且一次倒完信息,把Agent成功率从真人63.6%抬到最高77.8%。
τ-bench 这类 agent 评测已经把 LLM 当成用户:一边生成顾客话轮,一边给交互打分。客服、写代码、看病、社交场景都在用这套。模拟器像不像真人,几乎没人系统核过。
卡内基梅隆大学语言技术研究所把机器人领域的 Sim2Real gap 搬过来。这个词原指仿真里训出的策略放到真实世界会掉点,这里变成 LLM 用户跟真人用户的行为落差。论文问三件事:模拟器说话像不像人、打分像不像人、τ-bench 按数据库终态给的 0/1 奖励能不能代替真人反馈。他们从 Prolific 找了 451 名标注者(18–80 岁,均值 39,44% 女性),在 165 道航空订票和零售售后任务上替换掉原来的 LLM 用户,跟同一个 Agent(GPT-5.2)对话,再拿 31 个模拟器对照。
对齐分两层。行为层看四维:沟通风格(D1,礼貌、长短、标点)、信息节奏(D2,每轮倒多少订单号、邮箱这类标识)、澄清习惯(D3,含糊还是一口咬定)、出错反应(D4,会不会骂、会不会换策略)。词表用 LIWC2015 和 NRC 情绪词典,结构特征用正则。每维用 Sørensen–Dice 系数对齐人群分布:两个比例的重叠程度,100 分表示跟真人完全重合。
结果层看两件事。一件是任务成败校准,把题按难度切成 5 档,算模拟器成功率和真人成功率的 Expected Calibration Error(ECE,期望校准误差),越低越准。另一件是交互质量:对话结束后填同一份问卷,任务完成用五档(政策限制未办成、失败、部分完成、完成、超出预期),外加效率、提问量、回答费力程度、像不像人、流畅度、愿不愿意再用。模拟器打分跟真人打分的平均绝对误差转成 Eval 分。
六项平均得到 User-Sim Index(USI),0 到 100。没有问卷的模型去掉 Eval,五项平均。真人三批标注之间的互相比对当天花板。31 个模拟器分成闭源 18、开源 9、专门微调用户模拟的 4 个:CoSER-8B、UserLM-8B、HumanLike-7B、HumanLM-opinion。每题三批独立标注,报告跨批次均值和标准差。
最好的模拟器是 DeepSeek-V3.1,USI 76.0,真人天花板 92.7。闭源最高是 Gemini-2.0-Flash 的 74.7。专门微调的四个全没补上缺口,HumanLM-opinion 掉到 46.9。打分最贴近真人的是 Claude-3-Haiku(Eval 78.3),可它的沟通风格 D1 只有 22.1,USI 被拉到 61.8。会打分不等于会扮演顾客。
| 模拟器 | USI | Eval |
| 真人互相比对 | 92.7 | 97.4 |
| DeepSeek-V3.1 | 76.0 | 74.3 |
| Gemini-2.0-Flash | 74.7 | 73.7 |
| Llama-4-Maverick | 73.7 | 76.7 |
| GPT-5.1 | 73.5 | 72.1 |
| Claude-3-Haiku | 61.8 | 78.3 |
| HumanLM-opinion | 46.9 | 61.6 |
行为上四个维度全偏。D1:GPT-4o 只有 1.0% 的短句,真人 29.0%;礼貌句 49.0%,真人 15.3%。D2:UserLM-8B 每轮塞进 4.8 个标识符,真人 2.6,开场就把姓名、邮箱、订单号一次念完。D3:GPT-4o 14.6% 的话轮带不确定,真人只有 7.3%,任务写死了还在说「如果可以的话想退货」;UserLM-8B 反过来,不确定 3.0%、确定标记 10.6%(真人 1.0%)。D4:真人生气会说「这太离谱了,为什么不能免手续费」,模拟器更爱客气地换招,GPT-4o 策略转向 19.1%、CoSER 16.5%,真人 8.4%。UserLM-8B 还会开场自称客服。
这套过合作的用户把评测打成简单模式。同一个 GPT-5.2 Agent,真人用户成功率 63.6%,配 MiniMax-M2.5 到 77.8%,Claude-3.5-Sonnet 76.6%,Kimi-K2.5 76.2%。专门微调的四个掉到基线以下:CoSER-8B 57.6%,HumanLike-7B 42.6%。论文把原因写成复杂角色扮演的指令跟随不够,它们的 USI 也低。
打分侧同样偏。GPT-5.1 把「像不像人」高估 55% 的量表幅度,总分高估 18%;像人程度均值差 +1.11,愿不愿意再用 +0.83,任务完成度反而低 0.15。模拟器对体验打得松,对成败打得紧。
τ-bench 的 0/1 奖励跟真人观感基本正交:奖励为 0 的对话里,70.6% 被真人判成成功;奖励为 1 的里面,33% 被判失败或只完成一部分。奖励 0 和 1 两组在总分、效率、像人程度上分布几乎分不开。
通用能力更强,不一定更像用户。除了 GPT 系列,Arena Elo 跟 USI 对不上。给 GPT-5-mini 加了一版按发现写的人设 prompt,要求分批给信息、变语气、表达不确定、会顶回去。50 道题上 USI 从 70.9 掉到 64.6,ECE 从 0.18 坏到 0.29。礼貌和信息前置是近了,不确定和破折号用过头,情绪没上来,转向更糟。
谁还在用 LLM 用户跑 τ-bench 或同类交互评测,看到的成功率里有一块是模拟器送分。Agent 过的是一次给齐信息、出错也不吵的对手,不是会含糊、会不耐烦、会漏订单号的顾客。
模拟器还在,适合做快实验和粗筛。论文建议先用模拟器铺开比,再抽覆盖各域、含难含易的一小批给人跑,看排名和主结论还在不在。报告里行为、任务结果、用户打分要分开写,一个维度像人不等于别的也像。换 prompt 补人设,至少在这次消融里补不上。
这是带了对照实验的警告,不是新训练方法。要跟进的动作很具体:别把模拟器分数直接写成「对真人有效」。
作者自己列了几条。行为特征靠词表和正则,D4 统计的是全对话里的情绪和转向,不一定发生在 Agent 出错之后,也没报这个指标抓得有多准。标注者是在角色扮演,不是真的要改机票的顾客;人群偏英语美国。主实验只固定了一个 Agent,附录用 Gemini-3.1-Pro 复测,排序大体还在,绝对分会变。τ-bench 本身的题目和奖励质量问题会影响绝对数字,人机对照是在同一批题上做的,相对差仍然成立。编码、浏览器、医疗、开放社交这些场景没有测。
另外两处读下来站不稳。专门微调模型更差被解释成指令跟随弱,没有把失败轨迹拆开看,是不会扮演顾客,还是扮演得太怪把 Agent 带崩了。USI 六维等权平均,D2 普遍都在 70 到 88,D1 和 D4 拉开差距,等权会把「话术不像人」和「信息倒得太多」混成一个数。论文也说了 USI 是摘要,不能替代分项。