LLM模拟对话过配合,vanilla一致性9.5对真人5.2

Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction

Ryo Kamoi, Ameya Godbole, Binglin Zhou, Xiaoxin Lu, Longqi Yang, Rui Zhang, Mengting Wan, Pei Zhou

EMNLP 2026

cs.CL

2026-03-18

300场专业对话上,GPT-4.1一次写30轮一致性9.5、真人5.2;点名要冲突会过猛,微调只会堆重复。

这篇在解决什么

用大模型同时扮演一场会议里的所有人,已经成了社交模拟、政策推演、产品原型的常用办法。评测习惯跟着走:一致性更高、更好配合,就算模拟得更好。

真人开会不是这样。误解、打断、答非所问、把刚说过的话再讲一遍,都是日常。这些「不完美」会触发澄清、说服、妥协。如果模拟里人人配合、从不跑题,拿它当人类社交的替身会系统性偏乐观。

方法

微软、宾州州立和南加州大学给出 CoCoEval。两层评测并行。一层沿用 1-10 的会话级 Likert:一致性、配合度各打一个分。另一层在每一轮上检测 10 类行为,五类不一致(逻辑自相矛盾、事实错误、误解、冗余、重复),五类不配合(持续反对、打断、跑题、回避作答、意图不清)。成功标准不是「越少越好」,是频率接近真人。

基准叫 CoCoEvalBench。从 QMSum、NCPC、SIM、IQ2 里抽出商务、学术、政府会议和辩论,评测集 300 场。任务是:给定参与者信息、前 30 轮、更早内容的一段摘要,续写 30 轮。真人续写当参照。自动评测用 o4-mini,和五名标注者的相关与人与人之间差不多(配合度 Spearman 0.586,人际 0.441)。

模拟侧测了 GPT-4.1、GPT-5.1 Instant、Claude Opus 4。三种做法:普通「写得像人」提示;把 10 类行为清单塞进提示,要求频率对齐历史;在 1,450 场真人对话上对 GPT-4.1 做监督微调。每次调用生成 1、5 或 30 轮也分开测。Claude 生成 30 轮经常顶满输出长度,这组没报。

结果

真人续写的一致性和配合度是 5.2 和 5.7(95% 区间大约 4.8-5.6 与 5.3-6.0)。10 类行为都有,意图不清、回避作答、跑题、重复相对常见。

普通提示把分数推到接近满分。GPT-4.1 一次生成 30 轮是 9.5 / 9.7,一次一轮也有 8.2 / 8.6。GPT-5.1 和 Claude 更满,Claude 一次一轮 9.8 / 9.9。细粒度图上,这些对话几乎没有打断和误解。

把行为清单写进提示,模型会往反方向冲。GPT-4.1 一次一轮掉到 1.3 / 1.3,Claude 一次一轮 1.5 / 1.4。提示说的是「对齐真人频率」,模型理解成「每种都要演一遍」。一次生成 30 轮时,这份提示几乎失效,GPT-4.1 又回到 9.3 / 9.4。

监督微调能把 Likert 拉回真人附近:GPT-4.1 一次一轮 5.3 / 5.7。细粒度对不上。重复和冗余被放大,出现连着点头的段落,「Exactly / Yeah that makes sense / That's right」一轮轮往下排。presence penalty 压不下去。

Likert 还会漏报。GPT-5.1 加行为清单、一次一轮,分数 4.6 / 4.5,看着接近 5.2 / 5.7。人工读会发现同一事实被反复误解。轮级检测抓得到,会话级分数抓不到。

设置一致性配合度
真人续写5.25.7
GPT-4.1 vanilla, 30 轮/次9.59.7
GPT-4.1 行为清单, 1 轮/次1.31.3
GPT-4.1 SFT, 1 轮/次5.35.7

为什么重要

谁拿多 agent 对话当「虚拟用户」或「虚拟会议」,默认设置会产出过度配合的脚本。政策反应、冲突演化、调解策略,都会被画得太顺。

CoCoEval 的用处是诊断,不是刷榜。它说明「写得像人」和「冲突频率像人」是两件事,提示和微调都控不稳后者。做社交模拟至少要把打断、误解、回避单独计数,别只看一个 1-10 分。

局限与存疑

公开多人群聊高度偏向政府会议和辩论,商务会偏少,而且全是英文。o4-mini 对逻辑矛盾、事实错误等人际一致性本来就低的类别,和人的相关更弱,这些行为在评测域里也稀。评测器还偏爱多标「回避作答」和「意图不清」。

任务是续写 30 轮,不是从零开会。频率对齐的是同一段历史下的真人续写,不能直接外推到开放式角色扮演。SFT 只做了 GPT-4.1。Claude 没有 30 轮设置。没测开源小模型。细粒度频率来自柱状图,论文没有把每类行为的精确均值印成表。

术语

原文与代码

社区讨论

相关论文

全部论文解读