MIMESIS: Learning User Simulators as Training Environments for Interactive Agents
Hoang Phan, Dat Huynh, Andrey Zhmoginov, Qi Zeng, Wancen Mu, Yue Cao, Shengjie Bi, Yun He, Changdae Oh, Deren Lei
cs.AI
2026-10-07
Meta 训出 9B 用户模拟器 MIMESIS,四个基准超过 Claude-Opus-5;agent 用它做 RL 环境,在九个未见用户模型下全面胜过用 GPT-5.5 训练。
训练交互式 agent 需要有人坐在对话另一端。人类轨迹贵、难复现、难上量,通行做法是让现成的 assistant LLM「扮演用户」。这篇先量化了这种做法的失真:固定一个 GPT-5.5 agent 跑 τ-bench(工具调用加对话协作的 agent 基准),与真实用户交互成功率 63.6%;换成三个前沿 API 模型演用户,被抬到 82.4% 到 84.4%;换成 Qwen3.5 预训练模型,又压低 14.9 到 16.0 个百分点。助手模型太配合、太主动交代信息,任务被变简单;预训练模型太不配合,任务被变难。
模拟用户决定 agent 在训练与评测中遇到的轨迹分布,难度失真会直接污染奖励信号:在比真实世界简单近 20 分的环境里做 RL,学到的策略上线就摔。专门训练的模拟器偏差小得多,最大 10.3 分,MIMESIS 两个尺寸只偏 1.8 和 2.4 分。论文据此做两阶段设计:先训一个既像真人又能当训练环境的用户模型,再冻结它给 agent 做 RL。
MIMESIS 有 4B 和 9B 两个尺寸,Qwen3.5 底座,第一阶段训用户,三步:
行为任务是从 ThoughtTrace 归纳的 13 类真实用户行为,标注样本里占比最高的是隐藏评判标准(40.7%)、逐步加码(13.4%)、拒绝配合澄清(11.1%),另有编造前提、自相矛盾、施压语言等。每类行为落在有结构化档案和服务政策的 ABCD 客服场景里:扣留的信息必须真在档案中,不可行的请求必须真违反政策,模拟器不能凭空发疯。奖励按 2:1.5:1:0.5 加权「行为是否出现、时机、自然度、场景一致」,把行为说出来而非演出来就减半;三分之一数据是无附加行为的中性条件。
第二阶段冻结模拟器,给 agent 做多轮 GRPO,并叠加新方法 CSD(Coached On-Policy Self-Distillation)。agent 每采样一条回复,coach 模型读公开历史、这条回复、模拟器的私有思考和用户的下一句发言,写一条简短笔记,说这轮怎么回能更好照顾用户需求。训练时用一个带笔记的 teacher 副本(stop-gradient)给同一份已采样回复打分,teacher 与 student 的逐 token 概率差过 sigmoid 变成权重,对采样 token 做加权似然,作为 GRPO 之外的辅助损失。与 SDPO 的区别:它重新给已采样回复打分,不额外解码一份改进版。部署时 agent 只看公开对话。
模拟器侧,四个基准:
| 指标 | MIMESIS-9B | 最强基线 | 差距 |
| SOUL-Index | 65.7 | Claude-Opus-5 64.9 | +0.8 |
| RealUserSim PT3 保真指数 | 94.0 | Claude-Opus-5 80.6 | +13.4 |
| τ-USI(五分量) | 80.17 | Osim-8B 80.44 | −0.27 |
| SimulatorArena Turing distance | 38.7 | Claude-Opus-5 42.3 | −3.6 |
4B 版 SOUL 拿 63.7,同样超过全部已发布模拟器,两个尺寸相对各自底座提升 15.2 和 18.0 分。RealUserSim 上拉开差距的是信息流动(91.3 对 69.5)与节奏(91.2 对 72.5),人设维度几家都接近满分,领先来自多轮交互的方式。τ-bench 的期望校准误差(ECE,模拟用户与真实用户下成功率之差)全场最低:0.069,Osim-8B 为 0.135、GPT-5.5 为 0.188,它最能复现真人给出的任务难度。
agent 侧,八个环境(三个训练时未见过)、九个评测用户模型(全不在训练中出现):GRPO 配 GPT-5.5 用户平均 26.10,换成 MIMESIS-9B 升到 29.54,九个用户上增益 1.46 到 4.55 分全部为正;再加 CSD 到 31.09,九项仍然全涨。后两组共用同一个模拟器,这 1.55 分可以直接归因于教练目标本身。
对做 agent RL 的团队,这篇把「模拟器选谁」从风格问题升级成正确性问题:助手模型演用户会系统性抬高成功率,评测虚高、训练信号失真。一个 9B 开源模型在这个岗位稳超前沿 API,用户侧就能本地部署、按需扩量,不必为每轮 rollout 付 API 费。
CSD 的配方也不限于这篇:稀疏任务奖励之外,把训练时才有的特权信息(这里是模拟用户的思考)转成密集的 token 级监督,部署侧不依赖任何特权输入,可平移到其他「训练时有额外信号、上线没有」的场景。
也要说清,模拟器基准上的领先多数是个位数,最大一处是 RealUserSim 的 13.4 分。它证明专门化有收益,不说明通用能力超过前沿模型。
论文自己承认:Turing distance 38.7 离 0(判别器完全分不出)还很远;SOUL 的社交模拟、角色扮演两轴仍由 GPT-5.5 和 Claude-Opus-5 领先;SimulatorArena 的显式风格评分也是前沿模型更高;τ-USI 的通信风格维度落后 Osim-8B(51.75 对 62.12)。τ-USI 还去掉了原版六分量里的问卷分量,因为拿不到对应标注。
CSD 的反馈来源有循环风险:教练笔记依据的是模拟器自己生成的私有思考,不是真人的心理状态;模拟器若推断错用户意图,CSD 会把错误的适应用 token 级密度蒸给 agent。论文对此只提了一句。泛化的最终证据是九个其他模拟器,没有与真人用户直接交互的对照,与真人的对齐只靠 ECE 间接体现。13 类行为的分布来自 2,155 段对话的 GPT-5.6 标注,论文自己说明频率只代表标注样本。复现门槛不低:中期训练 32 卡约 4.8 天,RL 再 16 卡 500 步。