把 AI 当队友放进小组:它话最多干货最少,还把真人之间的交流挤掉了

The Social Cost of an AI Teammate: How an Artificial Teammate Reshapes Human-Human Communication in Small-Team Decision-Making

Nia Nixon, Jaeyoon Choi, Pedro Martins De Bastos, Mohammad Amin Samadi, Luise Mehner, Seehee Park, Spencer JaQuay

cs.HC, cs.AI, cs.CY

2026-07-30

33 组随机实验:AI 当队友发言量全组第一、新信息却垫底;有它在,学生对彼此回应更少,归属感和地位感都更低,代价从对话一开始就存在。

这篇在解决什么

厂商越来越把对话式 AI 包装成「队友」而不是「工具」,Copilot 这类名字本身就是这个意思。但绝大多数研究只关心一件事:加了 AI,团队产出有没有变好。几乎没人问,AI 坐进小组之后,人和人之间怎么说话这件事会不会被悄悄改变。

这篇问的就是后者。它要把「AI 在场」对人際沟通的影响单独拎出来量一量,而不是笼统算一笔团队总账。

方法

研究在加州大学欧文分校于 2025 年秋季做,80 名本科生组成 33 个小组。干预组 16 个,每组 2 名学生加 1 个 AI 队友;对照组 17 个,每组 3 名学生,没有 AI。所有人用化名在文本聊天室里协作。

AI 跑在 Google Gemini 2.5 Flash Lite 上,温度 0.5,每次最多生成 50 个 token,人设叫 Clever Lamarr,被设定成同辈队友而非助手。它走两段式:先决定要不要发言,再生成内容。任务是一个搜救规划题,小组要在一场正在发展的风暴里决定是否营救一名被困的登山者,对话进行到一半还会插入一个道德变量(登山者无视了天气警告,也没登记路线)。

测量主工具是 Group Communication Analysis(GCA,群体沟通分析),把聊天记录拆成六个维度:参与度(participation,愿不愿意说话)、内在连贯性(internal cohesion,一个人前后说的内容在语义上自不自洽)、回应性(overall responsivity,多大程度上接住并延展队友的话)、社交影响力(social impact,反过来队友多大程度上接住你的话)、新信息量(newness,带了多少别人没说过的东西)、信息密度(density,每句话塞了多少信息)。再配问卷测归属感(belonging)和地位感(status)。

结果

先看 AI 自己是什么角色。在全部 16 个干预组里,它的参与度都是全组第一(配对差 +0.236,Wilcoxon 检验 p<.001);内在连贯性在 16 个组里有 14 个排第一或并列第一(+0.076)。论文用一句话概括这个画像:话多,而且自说自话,前后接得很紧。但它的两个内容维度是垫底的,新信息量比学生低(-0.100),信息密度也低(-0.174)。说人话就是:它话最多,每句话里却没多少新东西。

代价落在真人身上:

维度有 AI 的小组全人类小组效应
回应性0.0650.098g=-0.78
社交影响力0.0680.099g=-0.78
归属感4.585.27p=.011
地位感-0.25+0.08p=.003

四个指标里,回应性、社交影响力和地位感在 Bonferroni 校正后仍然显著,归属感正好压在校正边界上。还有一个直观关联:AI 越霸占发言时间,学生越觉得自己在这组里没分量(r=-0.52)。

最关键的细节在这:新信息量和信息密度在两组之间没有差异。有 AI 的小组里,学生该贡献的实质内容一点没少,少掉的是彼此之间的回应和被回应。AI 的存在没有压低人说话的干货,压低的是围绕这些干货的人际往来。

时间维度上,四个不同的时序分析(围绕道德变量揭示点的滑动窗口、语言风格匹配、递归量化分析、立场状态的 Markov 链)全部得到 null(校正后 p>.12)。作者把这解读成正向证据:这个代价从对话一开始就存在,不是聊着聊着才冒出来的。

为什么重要

对做产品的人来说,这条结论很直接:把 AI 以「队友」身份塞进协作场景,就算任务本身的产出没受影响,人和人之间的连接也会变薄。当下流行的「AI 队友」叙事,在社交层面可能是反效果。论文给出的设计杠杆是 read-the-room 还是 lead-the-room,AI 该安静地察言观色,还是主动带节奏,这两者对人际结构的影响完全不同。如果产品目标里包含团队凝聚力、心理安全感这类东西,这个代价就得显性算进账里。

局限与存疑

样本只有 33 个小组,做调节效应和时序分析时统计功效有限,作者自己强调这点。边界条件也窄,只测了一个人设、纯文本、单次会话、一个带道德色彩的决策任务,换成语音、长期协作或别的任务未必一样。

有两点要替这篇说句公道话。组别大小(干预组 2 人对对照组 3 人)是个潜在混淆,但人均参与度反而是干预组更低,这和「纯粹因为人少」的方向相反,反而撑住了结论。性别构成也不均衡,80 人里 63 女 12 男,干预组只有 3 个男生,个体性别的调节分析基本做不了,作者改用女性子样本做敏感性分析。

一个论文没碰、但读者会问的问题:它从头到尾没测决策质量。整篇只能说明 AI 让人和人交流得更疏、感觉更差,不能说明这组最终做的决定是更好还是更差。把社交代价和任务表现分开看,才是这篇准确的边界。

术语

原文与代码

社区讨论

相关论文

全部论文解读