Nature 研究:GPT-4 可高准确度预测社科实验结果
《Nature》发表的一项最新研究提出,大语言模型可以高度精准地预测社会科学实验结果。研究团队把实验材料和受试者人口统计信息输入 GPT-4,让模型模拟参与者作答,据此估计处理效应并与真实结果对比。该工具极具成本效益,作者呼吁将其作为辅助人类的工具而非替代品。
已确认
作者在 70 个预注册社会科学实验上评估模型,样本覆盖 469 个效应、119,330 名参与者,数据来自 TESS 和复现实验。据 Robb Willer 转述,GPT-4 生成的效应估计与真实效应高度相关,相关系数为 0.85;按效应大小的不确定性校正后,相关性达 0.92。
此外,GPT-4 的预测能力与 2,659 名人类受试者的汇总预测相当,若将人与模型的预测平均结合,相关性还能提升至 0.89。在成本方面,经过重新校准后,纯 LLM 试验的成本不到 1 美元,其预测误差却接近一个约 230 人的人工试验组(成本约 736 美元)。模型表现并非单纯因为“记住已发表结果”:即便实验在训练截止前未公开、甚至到 2025 年 6 月仍未发表,GPT-4 的预测相关性依然很高。
局限性与学界反馈
LLM 预测存在系统性偏差,平均预测结果约高估 2 倍。在处理小效应、稳定的既有态度、现场实验以及非文本处理时,其准确率会明显下降。在针对 460 位社会学家的调查中,学者们最担心刻板印象、准确率不均和替代人类等问题,但仍有 76% 的受访者表示有 50% 以上的概率会在样本量分析、干预筛选等场景使用该技术。
为什么重要
作者现已公开 Nature 论文、免费手稿、交互式 demo(treatmenteffect.app)以及数据和代码,呼吁外界继续检验该方法的有效边界与负责任的使用方式。这类工具最适合用于经过验证的用途,应当是辅助人类,而不是替代人类。
2026-07-23 ~ 2026-07-24 · 18 条相关
一手来源
- Nature 论文发现 LLM 能预测社会科学实验结果 — RobbWiller ·
- GPT-4 在 70 个社会科学实验上预测相关性达 0.85 — RobbWiller ·
- Nature 研究放出论文、demo、数据和代码,测试大模型预测社会实验 — RobbWiller ·
- Nature 研究:GPT-4 可精准预测社会科学实验结果 — RobbWiller · 2026-07-23
- Nature 论文称 LLM 可预测社会科学实验,相关性达 0.85 — RobbWiller · 2026-07-23
- 70 个实验基准显示 GPT-4 预测效应相关性达 0.85 — RobbWiller · 2026-07-23
- GPT-4 对未发表社会科学研究仍保持高相关性 — RobbWiller · 2026-07-23
- GPT-4 预测能力已接近 2659 人群体判断 — RobbWiller · 2026-07-23
- LLM 预测平均高估 2 倍,现场实验上更弱 — RobbWiller · 2026-07-23
- 纯 LLM 试验不到 1 美元,效果接近 230 人人工试验 — RobbWiller · 2026-07-23
- 76% 受访社会科学家愿意用 AI 做功效分析和试点测试 — RobbWiller · 2026-07-23
- 调查显示社会科学家最担心偏见、可重复性和替代人类 — RobbWiller · 2026-07-23
- 研究者开放社会科学处理效应预测 demo — RobbWiller · 2026-07-23
- 【源头】Nature 论文发现 LLM 能预测社会科学实验结果 — RobbWiller · 2026-07-23
- 《Nature》解读:LLM 能预测社会科学实验结果 — RobbWiller · 2026-07-23
- 【源头】Nature 研究放出论文、demo、数据和代码,测试大模型预测社会实验 — RobbWiller · 2026-07-23
- Nature 论文称 GPT-4 可预测社会科学实验结果,相关性达 0.85 — JeremyNguyenPhD · 2026-07-24
另有 4 条近重复转述:RobbWiller · RobbWiller · RobbWiller · RobbWiller