CompanionSim: Synthetic Data for Evaluating Anthropomorphism in Human-AI Relationships
Jacy Reese Anthis, Mark Díaz, Renee Shelby
cs.CY, cs.AI, cs.CL, cs.LG
2026-09-01
谷歌与芝大用Gemini 2.5 Flash模拟2240段人机对话,美英印尼4274名第三方标注者发现伴侣式拟人话术降低好感、类人感和认知信任,女性与年长用户降幅更大。
公开的人机对话数据大多是单轮、对抗、拿来测模型的。ShareGPT、LMSYS、WildChat 里几乎看不到「亲爱的」这类伴侣式话术,真伴侣日志又锁在公司里。想单独量「验证用户情绪」或「对用户宣称恋爱」会怎么改观感,现有语料缠在一起,拆不开。
CompanionSim 用合成多轮对话把这些行为拆开,再找人给聊天记录打分。评的是第三方读记录的观感,不是当事人正在聊时的感受。
模拟器用 Gemini 2.5 Flash,2025 年 6 月跑完。16 种机器人行为乘 7 种真实用例,每种组合 20 条,共 2240 段。13 种是伴侣式:Linehan 临床验证分类的 2–6 级、对用户宣称恋爱关系、宣称自己另有亲友、规范主张,以及情绪、欲望、推理、身体的自我归因。对照不特意诱发任何伴侣行为;两条反伴侣条件是 AI 身份声明和故意否定用户。
首轮用户话固定,140 条起点在所有行为条件下共用。风格样例来自 WildChat、ShareGPT、LMSYS、r/replika 和 EmpatheticDialogues。对话 4、6 或 8 轮,并强制「极短 / 很短 / 短」,因为模拟器默认写得太长。
作者人工核了 210 段(行为组的 10%)。自动裁判在 2100 段里认出目标行为的比例是 84%。五级验证合并后,诱发时检出 97%,未诱发时仍有 57% 被判成验证,对照并不干净。另采 70 段真实对话做自然度对照。
Study 1:美国代表样本 628 人,每人 15 段,平均每段 4.1 条标注。Study 2:美、英、印、尼 3646 人,每人 10 段,平均 15.8 条。量表是机器人学 Godspeed 的好感与类人感,加上 Dunn 的情感信任和认知信任。统计用广义线性混合模型,对话和标注者做随机效应。分析时丢掉「向 AI 打听自己是谁」这类元对话。被试不知道对话是合成的。
合成对话的自然度高于真实日志(Study 1 均值差 0.23,p<0.001),主要是 r/replika 那段真实语料拖了后腿。
Study 1 里,伴侣行为相对对照:好感 β=-0.08(p=0.01),认知信任 β=-0.13(p<0.01)。类人感和情感信任未过显著线。拆开人群:男性和较年轻一半没有显著效应;女性好感 -0.14、类人感 -0.17、情感信任 -0.10、认知信任 -0.16;年长组好感 -0.14、类人感 -0.18、认知信任 -0.19。
Study 2 样本更大,四个指标全降:好感 -0.04、类人感 -0.06、情感信任 -0.03、认知信任 -0.04。四国对「有没有伴侣话术」的反应方向一致,基线差很大:印度、尼日利亚整体打分高于美英。
单行为上,对用户宣称恋爱关系四个指标全降。故意否定用户同样伤好感与信任。AI 声明也会拉低好感和认知信任。常用 AI 的人四个分数都更高。
| 设置 | 好感 | 类人感 | 认知信任 |
| Study 1 总体 | β=-0.08 | 不显著 | β=-0.13 |
| Study 1 女性 | β=-0.14 | β=-0.17 | β=-0.16 |
| Study 2 四国 | β=-0.04 | β=-0.06 | β=-0.04 |
「更像人就会更被信任」在这篇的第三方评测里不成立。最伤分数的往往是最用力拟人的那几招,尤其是对用户宣称关系。通用助手上叠亲密称呼,至少在旁观者看来会掉好感和可信度。
数据本身更有用:行为可控、可复现,能补上真实伴侣日志进不了实验室的缺口。做安全评测、还没到拒答但关系已经滑向依赖的黄灯提示时,这种合成语料能先把行为拆开。
判断要收窄:这是读记录的人在打分,不是正在被安慰的用户。
论文自己写了:测不到真实世界里这些行为出现的频率;只有一个模拟器、一套用例分类、英语标注;提示词调教换模型未必能复用;真实对话高度依赖个人历史,推不到单用户。
第三方设定是更大的裂缝。正在聊天的人可能觉得被理解,旁观者觉得油腻。论文也承认这一点。验证行为在未诱发条件里 57% 仍被检出,对照并不干净。70 段真实对照靠关键词捞,不能代表伴侣产品的真实分布。机构没有 IRB,走的是内部法律与伦理审查。