2026-08-01
让 GPT-4 模拟代表性美国人群如何回应实验刺激、反推处理效应,其预测与 70 项真实验高度一致,超过人类预测者基准(r=0.79),但系统性高估效应、测不准亚组差异。
跑一次社会科学实验很贵:招够有代表性的被试、设计刺激、随机分组,一项研究动辄几千人、几个月。所以研究者长期想要一个便宜的事前预测,在做实验之前先估出处理效应(treatment effect),用来挑干预、做预实验、标出哪些结论值得复现。难点卡在预测者身上:招专家预测贵且慢,招人群预测更慢。
这篇 Nature 论文把大语言模型当成一个便宜的候选,问的是:能不能让模型扮演一个有代表性的美国样本,回答实验里的刺激问题,再从这些模拟回答里反推出实验本该测到的处理效应。Stanford 的 Ashokkumar、Hewitt、Ghezae、Willer 团队为此建了一个 70 项预注册调查实验的档案(469 个效应、近 12 万名被试)当 ground truth。
预测流程绕开了「让模型直接猜数字」。团队把实验的刺激材料喂给 GPT-4,让它模拟有代表性的美国个体会怎么回应,再把所有回答统一换算成百分点(满分量程记为 100pp),按人口学加权求出每个条件下的均值。某些画像(比如黑人画像)被过采样以支撑亚组分析,所以要用加权找回代表性。大多数实验没有指定对照组,于是每次随机挑一个条件当参照,算出预测的处理效应,再和用原始数据估出的真实效应求相关。这套随机参照重复 32 次,取中位数 r。整套档案折合 305 个独立条件、129 个结果变量、469 个处理效应。
关键在时间差:GPT-4 的训练截止早于档案里很多研究的发表时间。如果模型还能预测那些它训练时没见过的研究,就说明它在泛化地做「社会推理」,不是背答案。
核心结论:GPT-4 反推出的处理效应和真实效应强相关,而且超过了人类预测者的水准。论文招募的普通人预测者,其汇总预测与真实效应的相关 r = 0.79(校正后 0.84);GPT-4 的预测超过了这条人类基准,在各个亚组上 raw r 落在 0.62 到 0.85 之间。换几个主流开源权重模型,结论也站得住,而且这套能力对训练截止后才发表的研究(out-of-sample)依然有效。
但有两个清楚的边界。第一,模型会系统性高估效应大小。第二,它能预测「平均人会怎么反应」,却预测不了「谁反应更不一样」:处理效应与性别、族裔、党派的交互项,raw r 只有 -0.01、0.16、-0.03,基本等于瞎猜。在 15 项 megastudy(606 个效应)的次级档案上,相关性下降,但仍和专家预测者的汇总水平相当。
如果这套方法靠谱,它给社会科学补上一个低成本的事前预测工具:做实验前先用模型估效应,筛干预、做预实验、做功效分析;模型估得大而真实验做不出来的,正好标为需要复现。比起招人预测,成本低几个数量级。作者还调查了 460 名社会科学家(约四成女性、八成白人),梳理出预测试、干预筛选、复现甄别几类用途,以及偏差和误用两类风险。
对 AI 从业者的信号是另一面的:在足够多的人类文本上训出来的模型,内部已经编码了大量关于「人会怎么反应」的隐含知识,足以在受控任务上追平甚至超过人类预测者的汇总判断。
作者自己点出的:系统性高估效应,直接拿来当结论会偏;还有被批量用来「生成」支持某立场预测的误用风险。
更有分量的是审稿人的质疑(Nature 把审稿意见作为补充材料公开)。其一,评价指标不常规:论文主要用 raw r 和去除测量误差的 disattenuated r,而不是机器学习里惯用的 MAE/MSE/RMSE,而且全篇没给置信区间、没做显著性检验,所谓「超过人类」更多是描述性判断。其二,作者嘴上说 raw r 是主指标,实际论证却频频引用更大的 disattenuated r,有抬高数字之嫌。其三也是最刺眼的一点:out-of-sample 的预测竟比 in-sample 还准,审稿人直说这「令人不安」,在传统机器学习里这通常意味着数据泄漏,作者没正面解释。代码可复现性也被吐槽跑不通。
整体看,这是一条值得认真对待的能力信号,但「GPT-4 预测社会科学实验」目前更像是「在相关系数这个宽松标尺下,对平均效应的方向和量级估得不错」,离可靠的量化预测还有距离,亚组差异上几乎没用。