Nature 研究:GPT-4 可高精度预测社会科学实验结果

《Nature》发表的一项最新研究提出,大语言模型可以预测社会科学实验结果。研究团队把实验材料和受试者人口统计信息输入 GPT-4,让模型模拟参与者作答,再据此估计处理效应,并与真实实验结果对比。这一结果把 LLM 的用途从“生成文本”推进到“预判研究结果”,且具备极高的成本效益。

关键结果与表现

作者在 70 个预注册社会科学实验上评估模型,样本覆盖 469 个效应、119,330 名参与者,数据来自 TESS 和复现实验。按 Robb Willer 转述,GPT-4 生成的效应估计与真实效应高度相关,相关系数为 0.85;按效应大小的不确定性校正后,相关性达 0.92。此外,GPT-4 的预测能力与 2,659 名人类受试者的汇总预测相当,若将人与模型的预测平均结合,相关性还能提升至 0.89。

成本优势与局限性

这种方法展现出巨大的成本优势:经过重新校准后,纯 LLM 试验的成本不到 1 美元,其预测误差却接近一个约 230 人的人工试验组(成本约 736 美元)。然而,LLM 预测存在系统性偏差,平均预测结果约高估 2 倍。在处理小效应、稳定的既有态度、现场实验以及非文本处理时,其准确率会明显下降。

稳健性与学界反馈

模型表现并非单纯因为“记住已发表结果”:即便实验在训练截止前未公开、甚至到 2025 年 6 月仍未发表,GPT-4 的预测相关性依然很高。在针对 460 位社会学家的调查中,学者们最担心刻板印象、准确率不均和替代人类等问题,但仍有 76% 的受访者表示有 50% 以上的概率会在样本量分析、干预筛选等场景使用该技术。作者现已公开 Nature 论文、免费手稿、交互式 demo(treatmenteffect.app)以及数据和代码,呼吁外界继续检验该方法的有效边界与负责任的使用方式。

2026-07-23 ~ 2026-07-23 · 15 条相关

另有 2 条近重复转述:RobbWiller · RobbWiller