37 个 LLM 冒充 263 名员工填问卷,赢不过一个不含语言模型的统计基线

Plausible but Not Valid: A Psychometric Audit of LLMs as Synthetic Survey Respondents

Mantas Lukauskas, Viktorija Šarkauskaitė

cs.CY, cs.AI, cs.CL, stat.AP

2026-07-07

让 37 个 LLM 假扮真实员工填 68 题组织心理学问卷,最好的模型总相似度 0.71,被高斯 copula 统计基线逼平;换一个学历字段答案整体漂 0.56 个标准差,合成受访者换不来真样本。

这篇在解决什么

让 LLM「假扮一个 35 岁的立陶宛中层填问卷」,拿它的回答当数据,已经是社科圈的常见操作:做试点研究、算统计功效、甚至直接顶替人类样本发论文。此前的评估基本停在「单题答案看起来像不像人」,这批工作给了可行性证明,却没回答测量学层面的问题:合成受访者的联合分布、信度系数、中介路径、人口学效应还成立吗?

这个问题比「像不像」要紧。一个条目均值全对但条目协方差全错的合成样本,会让每个基于量表分数的条件分析膨胀第一类错误;一个亚量表均值全对但亚量表间相关全错的样本,会毁掉所有碰多构念的因果中介。这篇论文把审计标准从「单题」拉到了「心理测量结构」。

方法

基准数据是一份真实的立陶宛组织心理学调查:263 名员工、三份国际通用量表(IWPQ 工作绩效、UWES-17 工作投入、Dunham ATC 变革态度)加一个自构量表,共 68 题、12 个亚量表,并带有文献记载的「态度→投入→绩效」中介结构。选立陶宛样本是个刻意设计:低资源语言、量表为英文和荷兰文原版的翻译版,LLM 无法靠英文预训练语料直接对答案。

37 个模型(OpenAI、Anthropic、Google 加 22 个开源权重)在真实受访者的人口学档案上做角色扮演,档案只含性别、年龄、学历、职位等 11 个字段,绝不含该人的真实答案。整套审计由几层设计撑起来:

全套约 6.5 万份合成问卷,分析计划在第一次调用 LLM 之前预注册锁定。

结果

对比项数值
人-人天花板 PSS0.825
最佳 LLM(gpt-5.4-mini)0.714
高斯 copula 基线0.688
相关矩阵分量:copula vs 最佳 LLM0.95 vs 0.52
判别器区分合成与真人:AUCcopula 0.39,LLM 中位 0.999
合成训练回归器对真人 R²−0.18(人类自训 0.28)

几个结论比排行榜本身更有分量。LLM 确实复现了人类心理测量关系的方向:36/37 模型恢复出正向中介路径,角色差异在所有模型上方向全对,persona 从 C0 加到 C3 平均抬 0.18 个 PSS。但一到样本驱动的分量(分布、相关、信度),copula 碾压全部 37 个模型:LLM 生成的 68×68 相关矩阵结构性地过度连贯,人类数据里可区分的构念被压成一个方向。判别器实验最直白:copula 生成的样本和真人混不可分(AUC 0.39,低于随机),而每个 LLM 都被近乎完美地认出(中位 AUC 0.999)。

反事实换字段实验换掉 persona 里唯一一个人口学字段再重跑:学历互换平均拉动 0.56 个标准差(单亚量表最大 1.50),而同样的真实样本里学历对比并不支持这个量级;角色互换 0.18,性别互换 0.12,后者在人类样本里是零效应,纯属捏造的刻板印象。三个轴的不对称(0.56 : 0.18 : 0.12)在全部 37 个模型上方向一致。

两项排查堵住了替代解释。逐字回忆探针显示最差模型的题干复述率也只有 4.7%,22 个模型精确为零,回忆率与 PSS 的秩相关为 0.00,排除背题。模型间同质性检查显示 LLM 互相之间的相似度(0.733)高于任何一个 LLM 对人类的相似度(0.71),「多模型集成取平均」的集成分数塌到 0.305,比任何单模型都差:各家模型在出错的方向上是相关的,平均只会强化共同误差。

为什么重要

对做用户调研、政策测试、问卷试点的人,这篇给出了明确的分界线。要方向性判断(某效应是正是负),persona 条件下的 LLM 够用,而且便宜。要样本级替代,这篇直接否了:合成数据训练的预测模型对真人 R² 平均为负,比直接猜均值还差;默许偏移(系统性更倾向同意)平均 +0.84 个标准差,任何依赖分布形状的分析都会被带歪。

方法论上的贡献更通用:给 LLM 评测加统计基线、加留出人类天花板、给相似度指标加置换零假设。一个只在 LLM 之间互排的排行榜,完全可能与「全体输给无语言模型基线」同时成立。做 agent 评测、合成数据的人值得把这个设计抄走。

局限与存疑

作者自己列的:单一立陶宛样本(n=263),对其他国家、行业、构念的外部效度没验证;人类基准本身是自评数据,带社会赞许偏差,LLM 与人的差距里有多少是人的偏差说不清;逐字记忆排除了,但英文原版量表的释义性接触没法排除,基准测的是「能否在见过工具书的前提下扮演」,不是「从未见过的工具」;headline 网格 n=100、重复 1 次,前五名之间的差距落在 bootstrap 置信区间内。

读下来还有一处要留意:37 个模型的阵容冻结在 2026 年 6 月,「差距不随模型代际缩小」的判断基于 2024 至 2026 两年代际,时间跨度不算长;copula 在小样本下的优势会随合成样本量增大而扩大(n=200 时 PSS 0.82),这个对比对 LLM 略不利,虽然不改变结论方向。

术语

原文与代码

相关论文

全部论文解读