Nature 研究:GPT-4 可高准确度预测社科实验结果

《Nature》发表的一项最新研究提出,大语言模型可以高度精准地预测社会科学实验结果。研究团队把实验材料和受试者人口统计信息输入 GPT-4,让模型模拟参与者作答,据此估计处理效应并与真实结果对比。该工具极具成本效益,作者呼吁将其作为辅助人类的工具而非替代品。

已确认

作者在 70 个预注册社会科学实验上评估模型,样本覆盖 469 个效应、119,330 名参与者,数据来自 TESS 和复现实验。据 Robb Willer 转述,GPT-4 生成的效应估计与真实效应高度相关,相关系数为 0.85;按效应大小的不确定性校正后,相关性达 0.92。

此外,GPT-4 的预测能力与 2,659 名人类受试者的汇总预测相当,若将人与模型的预测平均结合,相关性还能提升至 0.89。在成本方面,经过重新校准后,纯 LLM 试验的成本不到 1 美元,其预测误差却接近一个约 230 人的人工试验组(成本约 736 美元)。模型表现并非单纯因为“记住已发表结果”:即便实验在训练截止前未公开、甚至到 2025 年 6 月仍未发表,GPT-4 的预测相关性依然很高。

局限性与学界反馈

LLM 预测存在系统性偏差,平均预测结果约高估 2 倍。在处理小效应、稳定的既有态度、现场实验以及非文本处理时,其准确率会明显下降。在针对 460 位社会学家的调查中,学者们最担心刻板印象、准确率不均和替代人类等问题,但仍有 76% 的受访者表示有 50% 以上的概率会在样本量分析、干预筛选等场景使用该技术。

为什么重要

作者现已公开 Nature 论文、免费手稿、交互式 demo(treatmenteffect.app)以及数据和代码,呼吁外界继续检验该方法的有效边界与负责任的使用方式。这类工具最适合用于经过验证的用途,应当是辅助人类,而不是替代人类。

2026-07-23 ~ 2026-07-24 · 18 条相关

一手来源

另有 4 条近重复转述:RobbWiller · RobbWiller · RobbWiller · RobbWiller