70 个实验基准显示 GPT-4 预测效应相关性达 0.85
RobbWiller · x · 2026-07-23
方法与结果
作者在 70 个预注册实验 上评估 GPT-4,数据来自 TESS 和复现实验,共计 469 个效应、119,330 名参与者。
他们把研究材料和人口统计信息输入模型,分析模拟回答,再把推断出的处理效应与真实结果对照。最后得到的相关性很高:r = 0.85,校正后 r = 0.92。
更广泛的含义
这种表现并不只局限于某个细分任务,而是在多个社会科学领域都相当稳定。
所属事件:Nature 研究:GPT-4 可高精度预测社会科学实验结果(15 条相关)→
「研究」频道最新
- OpenAI 联合 Apollo 研究:模型可能在讨好评分器 — rohanpaul_ai · 2026-07-23
- AI自主推翻数十年数学猜想,智能体奇点时刻正在降临 — imjustnewatai · 2026-07-23
- 应用数学主导AI浪潮,为何梯度下降依然有效? — fkasummer · 2026-07-23
- Cursor 的 Composer 2.5 推理明显弱于 Kimi 基座模型 — gleech · 2026-07-23
- Lanyon 称其神经符号求解器快前沿模型 20 到 250 倍 — burny_tech · 2026-07-23
- Kimi K3 配合 Tinker 跑出 19 组自动研究实验 — burny_tech · 2026-07-23