Method, Mind, and Morality: How People Make Sense of Artificial Intelligence
Jacy Reese Anthis, Erik Brynjolfsson, James Evans
cs.CY, cs.AI, cs.CL, cs.LG, stat.ML
2026-08-25
芝大与斯坦福用37万篇新闻、139万条认证推文和ChatGPT前后57场访谈,画出AI认知三轴:方法、心智、道德。
「AI」这个词现在什么都能装:推荐算法、聊天机器人、自动驾驶、编辑器里的自动补全。同一套技术,投资人看成增长引擎,老师看成注意力毒药,工程师看成下一份工作的杠杆或威胁。CSCW 里已有大量局部研究,数据科学家怎么看 AutoML,组织怎么把决策交给算法。缺一张总图:人在这波数字心智涌入时,靠什么把混乱钉住。
芝加哥大学的 Jacy Reese Anthis、James Evans 和斯坦福的 Erik Brynjolfsson 不问谁赢了伦理辩论,也不测模型分数。他们问人们怎么给 AI 赋意义。
研究走计算社会科学近年常用的计算扎根理论:先用大规模文本画出话语地形,再用访谈把地形里的人走一遍。时间卡在 ChatGPT 前后。2021 年第一轮 30 场访谈,2023 年第二轮 27 场,13 人两轮都参加。文本从 2018 年铺到 2024 年中。
新闻来自 ProQuest 全球英文报纸,原始 530,445 篇,滤掉非英文、过短和 OCR 质量差的之后剩 371,312 篇,平均 789 词。一篇新闻经常跨多个领域,实际建模只用搜索词前后两句,平均抽出 84 词。社交媒体用 Twitter 学术 API 抓认证账号,2018 年 1 月到 2023 年 4 月 20 日共 1,391,195 条,平均 24 词。搜索词覆盖 artificial intelligence、chatbot、large language model、neural net 等一整张表。
主题模型没用 LDA。LDA 把文档当词袋,话题一多就碎。这里用词向量上的 discourse atoms:k-means 加 SVD 字典学习,在同一空间里抽出话语原子。LDA 通常 10 到 20 个话题就开始散,这套方法能撑到 100 到 200 个还不崩。
访谈从 LinkedIn 上 2021 年 7 月的 AI 线上活动名单招人,不给报酬。去掉 3 人拒答人口学问题后,平均年龄 41 岁,77% 男性,现居美国 50%、印度 14%、英国 9%,AI 从业平均 9 年,中位数 5 年。职业以经理 20%、数据科学家 18%、研究员 16%、软件工程师 14% 为主。全程 49 小时录音,841 个一阶编码、213 个高阶编码,单人开放编码加轴心编码,追求理论饱和,不做评分者一致性。
话题模型给出一批原子框架,人工收成四类:系统组件(芯片、GPU、GPT-4、OpenAI)、应用场景(癌症、客服、自动驾驶、监控)、时间动态(加速、第四次工业革命、岗位替代)、社会议题(偏见、存在主义风险、欧盟立法、好莱坞罢工)。新闻更爱讲组件,Twitter 更爱讲议题。这些原子是积木,不是完整叙事。有人把 GPU 叠上「第四次工业革命」讲经济底座,有人把 GPU 叠上「恐惧」讲失控或环境代价。
访谈把积木钉到四件认知难事上。
跟不上。2023 年政策从业者 Marco 说很难想到「周末之后」。管理者 Diana 说技能「一夜过时」,新范式是「模型喂模型」,需要「科学里的艺术」。年轻从业者更兴奋、更少焦虑。
跨群体沟通。对家人,Meera 把工作说成「卖数据换钱」;Deepak 自称软件工程师,因为叔叔们都干这个。销售 Simon 碰上银行 IT 非要自己做「God bot」,结果连「笔记本坏了」都答不上来。
责任归谁。有人说系统是「一层叠一层」,没人懂全流程;有人说只有开发者能清偏见。最常见的归因落在数据上:「电脑只跟输入的数据一样偏」。一个大型国际组织的 AI 伦理委员会,因为无法把责任钉到人或系统上而散场。
怎么权衡。文献里有公平对准确、个性化对隐私,多数受访者否认权衡存在,或把选择推给别人。政策岗的 Marco 明确说只提供信息,不替任何人做选择。
这四件难事之上,争论收成三根主轴。
方法轴:自上而下的专家系统,对自下而上的规模涌现。深度学习已占主流,争论没停。批评者拿 COVID 当反例:相关当因果的模型全垮,A/B 测试和因果建模被「预测、预测、预测」挤走。支持者觉得规模化不可避免。Diana 把提示工程和特征工程都叫「艺术」,Eoin 说需要「文化变革和对人的投资」。
心智轴:工具对同事。扫地机器人和聊天机器人不在同一端。受访者把系统叫助手、早期「原实体」、隐形朋友;也有人坚持还是工具,同事那套是营销。人类化被很多人当成默认。Mark 做情感 AI 创业,认为没有共情的客服机器人只会把客户惹火。有人把人机关系说到奴隶制:Charles 用《星际迷航》对《机器人总动员》做对照,Raymond 反问造出比人更强的东西再奴役它,历史上效果如何。领先实验室的研究者 Ryan 反过来:没有主体性的系统是「一千万种人格的嘈杂」,没有总目标,不能套鞋子进去想。
道德轴:减速对加速。一边叠偏见、环境、大公司集权,要求监管跟上,Rebecca 在 2023 年说「对监管者非常失望」。另一边把伦理当已结案。关注收益的人常把 AI 说成把人类从下行螺旋里拉出来的外力。两端很少混着讲。
讨论部分还补了一刀。复杂立场会被话语机会结构剪成简单框。喊「超智能要来了所以要严管」可能被剪成「超智能要来了」,反过来刺激投资加速。论文点名 Sam Altman 曾说 Eliezer Yudkowsky 对创办 OpenAI 起了关键作用。框架也可以当资源:「随机鹦鹉」用来压炒作,「涌现能力」用来讲相变。拟人这层改不动,具体是助手还是原实体还没定,未定之处才是争夺点。作者把框架争夺接到生产率悖论上:电马达改了厂房布局才兑现效率,AI 可能卡在社会认知还没重配。
给做产品、政策和传播的人一张可复述的地图。你以为自己在讲细腻的风险分层,听众可能只听到「要来了」。设计上,把系统当工具还是当同事,会决定用户要不要共情、要不要问它算不算实体。政策上,减速和加速是道德框,不是单纯技术评估。研究上,把 Goffman 的框架理论和 Kaplan 的框架争夺接到 AI 话语,给「为什么 GPT 很强但宏观生产率还没动」留了一条社会认知解释。
这是一张描述图,不是操作手册。没有因果识别,也没有告诉你该站哪一端。
作者自己写得很清楚:探索性、解释性,不追求代表性,不做强因果。语料和访谈全是英文,样本偏美国、偏 LinkedIn 上爱参加线上活动的英语从业者,77% 男性,认证 Twitter 不等于全部社媒。词向量加字典学习抓不到完整语义。访谈高度互动,提问者的倾向会进回答。2021 和 2023 两轮之间世界变了,13 人重叠不够做前后对比统计。
另外几处站不太稳。三轴是事后收束,不是预注册的假设,别的研究者用同一批材料可能收成别的轴。原子框架的标签是研究者起的,五个近邻词不能证明公众真的在用这个框。责任归因和权衡两节里,「最常见」没有计数,只靠引语。讨论里「框架争夺导致生产率悖论」是机制猜想,论文明确说没有测因果。「God bot」和伦理委员会散场当故事很好读,外推到整个行业还差一步。