Learning User Simulators with Turing Rewards
Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu, Zexue He, Pengyuan Li, Alex Pentland, Roger P. Levy, Yoon Kim
cs.CL
2026-06-18
MIT与Stanford用LLM裁判给「像不像这个用户」打分,再GRPO训Qwen3-8B。对话域人类评委有57%选模型回复,内容匹配不掉,更强的GPT-5反而更像助手。
训助手已经是默认路径。反过来训一个「像某个具体用户」的模拟器,用途也不少:给 agent 当陪练、测个性化系统、在计算社会科学里当人类代理。卡点在分布,不在参数量。同一个人面对同一段上下文,能说的下一句远不止那条被记下的 ground truth。现有做法还是把训练信号钉在这一句上,要么最大化它的 log-probability,要么让 LLM judge 打内容相似度。模型学会的是复述,不是占据这个人的回复分布。
图灵测试的判据正好对上:评委分不出机器和人,机器就算过关。MIT、Stanford 与 MIT-IBM Watson AI Lab 把这条判据做成强化学习奖励,叫 Turing-RL。
每个用户先留一块与当前会话不相交的历史 h,再用辅助模型从 h 归纳一份 persona ρ,默认用户表示 u=(h, ρ)。给定当前上下文 x,策略要写出这个人可能说的 y。
训练两段走。先用 Qwen3-8B instruct 给每条 ground truth 写一段 chain-of-thought,解释这个人为什么会写出那句回复,LoRA 做 SFT 热启动,目标格式是推理轨迹加上 [HUMAN]: y。再上 GRPO:每个样本采 4 条候选,裁判 Qwen3.5-397B-A17B 看到用户历史和两条回复(真实用户与模型,顺序随机),按当下目标、动机、说话风格在 1–7 分上判哪条更像该用户写的。1 分偏向真实回复,7 分偏向模型。奖励把分数截到 5 再线性缩到 [0,1],写成 (min(s,5)−1)/6。截断来自预实验:模型会钻空子,写出「比用户更像用户」的回复来刷分。另加长度惩罚,生成回复相对 ground truth 太短或太长都扣,短的罚得更重。
基座是关掉 thinking 的 Qwen3-8B,LoRA rank 64、α 32,3 个 epoch。两条对照从同一份 SFT 出发、同样走 GRPO:Sim-RL 沿用 HumanLM 的内容相似度奖励;Logprob-RL 沿用 Gandhi 等人 2026 年的做法,用 ground truth 在模型下的长度归一化 log-probability 当奖励。
两个域。PRISM 多轮人机对话:1288 名用户,hold-out 128 人、880 轮。ConvoKit 的 Reddit 讨论:1282 名用户,hold-out 版块 r/tifu 与 r/worldnews,267 条。SFT 与 GRPO 的用户集合不相交,历史块与预测目标也不相交。
自动评测换成更强的 Claude Sonnet 4.6,避免训练裁判给自己打分。图灵分数 1–7,越高越像该用户。Turing-RL 在两个域都压过 Sim-RL、SFT 和 Logprob-RL,对话域差距更大。默认设定下对话域 4.31、Reddit 3.68。GPT-5 和 Qwen3.5-397B 参数量大得多,图灵分数几乎没比 Qwen3-8B 基座好:写得又长又客气,读起来像助手。内容相似度上,Turing-RL 和专门最大化相似度的 Sim-RL 持平,都高于 SFT。不可区分性没有把内容对齐打掉。
人类评测更硬。Prolific 招 360 人,每个条件 600 次二选一,看用户历史后选哪条是该用户写的。模型胜率如下,超过 0.5 表示评委把模型判成了该用户。
| 方法 | Chat 胜率 | Reddit 胜率 |
| SFT-Init | 0.49 | 0.41 |
| Sim-RL | 0.50 | 0.52 |
| Turing-RL | 0.57 | 0.50 |
对话域 Turing-RL 对 SFT 的配对置换检验 p=0.044,对 Sim-RL p=0.022。Reddit 上相对 SFT 有提升(p=0.0095),和 Sim-RL 分不出差别(p=0.61)。Reddit 题更长、人均阅读更慢,作者把这边的人类结果当成趋势验证。消融里只给历史、只给 persona、两者都给,图灵分数几乎不动;persona 够撑「像这个人」,不够复述那句具体的话,Reddit 的上下文贴合更吃原始历史。
给做用户模拟、个性化评测、multi-agent 陪练的人一条能跑的配方:别把奖励钉在那一句 ground truth 上,去优化「评委分不出」。对话图灵测试里,8B 加对的奖励打过 GPT-5。代码已开源。
这是训练信号上的改进,不是新架构。基座仍是 Qwen3-8B,也还没证明拿这种模拟器去训助手会更好。
作者认三件事。只覆盖开放对话和论坛,任务导向、谈判、协作解题没测。只在 8B 上比过奖励信号,换到前沿模型差距可能收也可能放。训练裁判是 Qwen3.5-397B-A17B,贵,也会把自身偏见写进策略;人类评测部分托了底,裁判和人的分歧模式没有细拆。
对话域 0.57 的胜率置信区间是 ±0.050,下沿贴着 0.5,显著但效应不大。内容相似度绝对值只有几个百分点,「没牺牲对齐」说的是相对 SFT 的名次,不是模型在复述原话。长度惩罚把回复长度钉在 ground truth 附近,图灵分数里可能有一部分只是「写得一样短」。能假扮特定的人,就能拿去伪造私信和社工;论文只在公开或知情同意的数据上训,声明用途是研究聚合行为,不是复现可识别个体。