The Rise of AI Companions: Interaction with AI Companions and Psychological Well-being
Yutong Zhang, Dora Zhao, Jeffrey T. Hancock, Robert Kraut, Diyi Yang
cs.HC
2025-06-15
分析 1131 名 Character.AI 用户与 46 万条聊天记录:整体多聊的人心理健康反而更好,但专为陪伴而用、表露越深的人得分越低,该负相关在高自我表露子群最强。
Character.AI 这类机器人越来越会「共情」,用户开始和它们建立类伴侣关系。一个绕不开的问题是:这种关系到底是在缓解孤独,还是在让人更糟。过去的研究答案矛盾,而且大多只靠问卷,看不到用户实际在聊什么。这篇论文把问卷、自由文本关系描述和真实的聊天记录三种数据拼到一起,想看清不同用法和心理健康之间到底是什么关系。
研究通过 Prolific 招了 1131 名美国 Character.AI 成年用户填问卷,其中 237 人捐出了聊天记录,共 4664 段对话、46.4 万条消息。团队用三套互补的指标衡量「陪伴型使用」:强迫二选一的主要用途、自由文本里对关系的描述、聊天记录里陪伴型会话的占比。分类用 GPT-4o,摘要用 Llama 3-70B,主题用 TopicGPT。互动强度用改编版 Facebook Intensity Scale,自我表露用 MOCA 量表的一个子量表,线下社交网络大小用 LSNS。心理健康取自 Comprehensive Inventory of Thriving 的六个题项,覆盖生活满意度、正负向情绪、孤独感、社会支持、归属感。最后用标准化系数的线性回归估计关联,给出 95% 置信区间。
一个反直觉的对照:整体聊天强度越高,心理健康越好(β=0.27、0.29,p<0.001);但同样是聊天,陪伴型使用和更低的心理健康挂钩,而且三种指标方向一致。
| 指标 | 与心理健康的关联 |
| 整体互动强度 | β=0.27(更高) |
| 陪伴型使用(自报主要用途) | β=−0.48 |
| 陪伴型使用(关系描述) | β=−0.32 |
| 陪伴型使用(聊天占比) | β=−0.27 |
陪伴型使用越多、表露越深的人,负相关越强:高强度子群 β=−0.31,高自我表露子群 β=−0.38。线下社交网络越小的人越倾向把机器人当陪伴用(β=−0.03)。
使用普遍程度本身就很说明问题:只有 11.8% 的人在问卷里把陪伴选为主要用途,但 51% 在自由文本里用了「朋友」「伴侣」这类词,捐出的聊天记录里 92.9% 至少有一段陪伴型对话。主题上,情感与社会支持出现在 80.3% 的会话,浪漫与亲密角色扮演 68.0%,涉及自伤、轻生等高风险内容的占 30.7%,出现轻生念头的占 18%。
对做陪伴型或社交 AI 的人来说,关键结论是效果因用法而异,不是「用得多就坏」。区别在于把机器人当工具还是当关系替代品,以及表露的深度。作者据此建议:这类系统与其鼓励用户把 AI 当连接来源,不如定位成有限工具,帮用户练习社交技能、建立关系意识。对产品和审核团队,18% 会话里出现的轻生相关内容也是一个明确的护栏信号。
作者自己最强调的一点:这是横截面数据,定不了因果。可能是陪伴型使用拉低了心理健康,也可能是心理健康本就更差的人更倾向这么用。数据还主要靠自报,捐聊天记录是自选的(用户挑了想分享的对话),样本会偏向数字素养更高的人。研究只覆盖 Character.AI 一个平台、美国英语用户,平台在 2022 年 11 月到 2025 年 1 月期间做过调整,作者拿不到内部审核规则的变化。
读下来还有一处要打折:最唬人的 β=−0.48 来自强迫二选一的指标,而只有 11.8% 的人选了陪伴;部分模型的 R² 只有 0.03,解释力有限。社交网络大小和陪伴使用的关联(β=−0.03)虽然显著,效应量也很小。