Nature 研究:GPT-4 可高精度预测社会科学实验结果
《Nature》发表的一项最新研究提出,大语言模型可以预测社会科学实验结果。研究团队把实验材料和受试者人口统计信息输入 GPT-4,让模型模拟参与者作答,再据此估计处理效应,并与真实实验结果对比。这一结果把 LLM 的用途从“生成文本”推进到“预判研究结果”,且具备极高的成本效益。
关键结果与表现
作者在 70 个预注册社会科学实验上评估模型,样本覆盖 469 个效应、119,330 名参与者,数据来自 TESS 和复现实验。按 Robb Willer 转述,GPT-4 生成的效应估计与真实效应高度相关,相关系数为 0.85;按效应大小的不确定性校正后,相关性达 0.92。此外,GPT-4 的预测能力与 2,659 名人类受试者的汇总预测相当,若将人与模型的预测平均结合,相关性还能提升至 0.89。
成本优势与局限性
这种方法展现出巨大的成本优势:经过重新校准后,纯 LLM 试验的成本不到 1 美元,其预测误差却接近一个约 230 人的人工试验组(成本约 736 美元)。然而,LLM 预测存在系统性偏差,平均预测结果约高估 2 倍。在处理小效应、稳定的既有态度、现场实验以及非文本处理时,其准确率会明显下降。
稳健性与学界反馈
模型表现并非单纯因为“记住已发表结果”:即便实验在训练截止前未公开、甚至到 2025 年 6 月仍未发表,GPT-4 的预测相关性依然很高。在针对 460 位社会学家的调查中,学者们最担心刻板印象、准确率不均和替代人类等问题,但仍有 76% 的受访者表示有 50% 以上的概率会在样本量分析、干预筛选等场景使用该技术。作者现已公开 Nature 论文、免费手稿、交互式 demo(treatmenteffect.app)以及数据和代码,呼吁外界继续检验该方法的有效边界与负责任的使用方式。
2026-07-23 ~ 2026-07-23 · 15 条相关
- Nature 研究:GPT-4 可精准预测社会科学实验结果 — RobbWiller · 2026-07-23
- Nature 论文称 LLM 可预测社会科学实验,相关性达 0.85 — RobbWiller · 2026-07-23
- 70 个实验基准显示 GPT-4 预测效应相关性达 0.85 — RobbWiller · 2026-07-23
- GPT-4 对未发表社会科学研究仍保持高相关性 — RobbWiller · 2026-07-23
- GPT-4 预测能力已接近 2659 人群体判断 — RobbWiller · 2026-07-23
- LLM 预测平均高估 2 倍,现场实验上更弱 — RobbWiller · 2026-07-23
- 纯 LLM 试验不到 1 美元,效果接近 230 人人工试验 — RobbWiller · 2026-07-23
- 76% 受访社会科学家愿意用 AI 做功效分析和试点测试 — RobbWiller · 2026-07-23
- 调查显示社会科学家最担心偏见、可重复性和替代人类 — RobbWiller · 2026-07-23
- 研究者开放社会科学处理效应预测 demo — RobbWiller · 2026-07-23
- 【源头】Nature 论文发现 LLM 能预测社会科学实验结果 — RobbWiller · 2026-07-23
- 《Nature》解读:LLM 能预测社会科学实验结果 — RobbWiller · 2026-07-23
- 【源头】Nature 研究放出论文、demo、数据和代码,测试大模型预测社会实验 — RobbWiller · 2026-07-23
另有 2 条近重复转述:RobbWiller · RobbWiller