Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions
Nicole Mitchell, Dhruv Agarwal, Maty Bohacek, Remi Denton, Roma Patel
cs.AI
2026-08-04
谷歌研究院与斯坦福的立场论文:NLP 应从单次会话评估转向纵向测量,用行为量表与长周期对话数据捕捉情感依赖、认知退化等长期风险,并接入对齐训练。
ChatGPT 面世四年,长期使用的后果开始有了案例:有人连续数月与聊天机器人对话后,在现实生活里采取了对自身有害的行动。谷歌研究院、斯坦福与康奈尔的研究者在这篇立场论文里给这类风险起了名字,纵向效应(longitudinal effects),并分成四类:社会情感(拟人化依恋、情感依赖挤占真实关系)、认知(把推理与记忆外包给模型导致技能退化)、认识(观点与信念被逐次微移,直至目标漂移)、临床(诱发或放大心理健康问题、成瘾式使用)。
问题的根源在评估的时间尺度。现有安全评测与 RLHF 都盯着单次交互里的可见风险:一次红队测试、一条 benchmark、一个会话内的谄媚回复。而这些风险多数是历时的(diachronic),只在数周、数月的持续交互里累积显形。推荐系统和 GPS 导航早就带来过类似的长期效应,论文的判断是,个性化、跨会话记忆和拟人化这三项能力把旧风险放大到了新的量级。
这是一篇提出研究议程的立场论文,核心主张是 NLP 需要三件基础设施:
论文没有原创实验,证据来自对已发表研究的综述。几个代表性数字:四周 RCT 里被试与 ChatGPT 聊社会情感话题,自报孤独感与社交意愿出现可测变化;21 天的伴侣聊天机器人 RCT 测得拟人化感知及其风险;12 周研究追踪自我表露与亲密感的变化。
论文给出的关键对照是:用户提十次抑郁相关内容,发生在单次会话里可能只是好奇讨论,分布在十周里则可能是高风险模式。两种情况 token 量相近,靠累积上下文判断时间的现有模型分不清。论文未给出任何新方法的实证对照,这不在它的范围里。
跨会话记忆和个性化正在成为各家产品的标配功能,这张路线图等于提前画出了这类功能的验收标准:不仅问「一次交互安不安全」,还问「三个月后用户变成什么样」。对研究者,心理学与 HCI 已有的量表体系、纵向研究设计都是现成可搬的,门槛在数据而非方法。对做产品的人,它列出的是一份迟早要面对的合规与伦理清单。
作者自己列了三条:自然发生的长期对话数据几乎全在平台手里,学术侧拿不到;量表体系有明显的西方文化偏倚,直接搬到跨文化场景会误判;纵向监测本身与隐私冲突,需要联邦日志、本地差分隐私兜底,静态知情同意也要换成动态同意。读下来还有一层张力论文没有展开:最有条件做纵向监测的一方,恰是靠参与度获利的平台,这个利益冲突不是技术方案能消掉的。作为议程设置文档,它的全部主张都还在等第一批实证工作检验。