500 题喂出的数字孪生,和本人相关只有 0.20

2026-10-10

哥伦比亚团队用 1784 人各 500 余题的档案做 LLM 孪生,同答 19 项新研究、164 个结果。个体准确率 0.748,只比空人格高 0.014;和本人的跨人相关平均 0.20。

这篇在解决什么

有人已经在用大语言模型当某一个具体的人,去填问卷、跑实验、做政策预演。支撑这个做法的早期数字看起来不差。两小时访谈造出的孪生,在综合社会调查上,准确率相对测试-重测大约 85%。公开面板 Twin-2K-500 在留出题上平均准确率 72%,相对测试-重测 88%。

这两个数都不好外推。访谈数据不公开,验证题和访谈内容隔多远也不清楚。Twin-2K-500 没有和只给人口学、或什么个人信息都不给的提示比过,孪生只复现了大约一半的人类实验效应。验证题又常常是文献里的经典范式,基座模型可能见过。

方法

主体在哥伦比亚,23 位合作者各拿自己的题来考。底库 Twin-2K-500 有两千多名美国被试,每人 500 多道题、约 12.8 万字符:人口学 14 题,人格 279 题,认知 85 题,经济偏好 34 题,启发式与偏差 48 题,定价 40 题。四波纵向,平均 145 分钟。重测还行,已知效应也大体复现。

孪生用上下文学习:问答整段放进提示,再答新问卷。默认 GPT-4.1(2025-04-14),温度 0.7。随机化按真人看到的版本保留,答案出了选项范围就重试。

19 个预注册子研究、164 个结果,累计作答 13506,独立被试 1784。题覆盖创造力、公共议题、隐私、公平、奢侈品、新闻、劳动力市场,混有已发表、未发表和新设计。人在 Prolific 先答,孪生答同一题,按人配对。

个体准确率是 1 减去平均绝对偏差占量程的比例。没有固定量程的开放题剔除,剩 161 个。相关按每个结果跨被试计算,Fisher z 平均后再转回。均值差用 Glass's Δ。对照是均匀随机、空人格(同一句不含个人信息的提示)、只给 14 个人口学,以及后文的 XGBoost。另外扫了温度 0、GPT-5、Deepseek、含 Gemini-3 Pro 的 Gemini、在这批数据上微调的 GPT-4.1,以及 Centaur。

结果

全人格孪生的个体准确率是 0.748。均匀随机已经 0.629,空人格 0.734,只给人口学 0.746。比空人格高 0.014,显著;比人口学高的 0.002 不显著,p=0.37。0.748 体面,是因为有量程的题往中间猜就不会得零分。

跨人相关平均 0.197。164 个结果里 157 个为正,Bonferroni 后 97 个显著。人口学 0.145,空人格 0.080,随机 0.001。0.20 大致是身高和智力那种相关。访谈孪生报过更高的相关,那是同一个人跨题目算的;这篇是同一道题跨人算,对得上「谁更可能同意」这种问题。

均值差 0.352 个标准差,大约相当于只用 10 个真人去估总体均值。105/164 个结果差异显著。孪生标准差低于人类的有 154/164,其中 140 个显著。

方法个体准确率与本人相关
全人格孪生,温度 0.70.7480.197
只给 14 项人口学0.7460.145
空人格0.7340.080
均匀随机0.6290.001
GPT-4.1,温度 00.7520.232
全人格 XGBoost,训练到 650 人文中未给单一汇总值仍低于 0.29

换基座和温度,最好的一档是 GPT-4.1、温度 0:相关 0.232,准确率 0.752。把 12.8 万字符压成大约 1.3 万字符的陈述式摘要,成绩和全人格差不多。Centaur 当基座不如 GPT。论文把原因留开:可能是底层的 Llama,也可能是格式,或这批评测题落在训练分布外面。

歪法有五处,都是同一批配对数据里看出来的。

个体化不足。全人格孪生离空人格的平均绝对偏差是 0.175,离真人是 0.252。多出来的档案把答案从基座模型拉开了一点,拉开的距离仍小于它和真人的距离。

刻板印象。全人格和只给人口学的平均绝对偏差是 0.132,比它离空人格、离真人都近。相关却拉得开。子研究 2 里「缺乏控制感」这一题,人口学相关 0.105,全人格 0.555,准确率只从 0.892 到 0.907。孪生更会把人排序,还是对不准这个人打几分。

谁被代表得好。用 61 个人口学哑变量训练 XGBoost,去预测每个被试跨题的准确率。偏依赖图上,学历更高、收入更高的人更准。党派立场居中、信仰活动出席频率居中的人也更准。

内容上的偏向。除 164 个细结果外,还预注册了 31 项更高一层的比较。孪生比本人更偏向「人是好的」这一侧:更相信别人公平、可信,更赞成自己照料自己,对给两个党派都捐过款的人评价更高,更支持监管市场里的附加费用,也更愿意纳税去改善所有人的医疗。同时又更偏向技术这一侧:更能接受算法筛选求职者,觉得在线定向没那么侵犯隐私,少报 Netflix 和 TikTok 的使用。给点子的创造力打分时,来源如果是人,孪生打得更低。

过度理性。有标准答案的题上,孪生近乎全会。新颖范式里,吸引效应和妥协效应出不来,默认选项效应也不出现。换成文献里那个经典的默认选项范式,孪生又表现得很强。论文把后一种算作训练文本泄漏:范式著名,答案可能已经写在基座模型的语料里。

68 位专家,主要是学者和业务负责人,去猜五个子研究里处理组的平均结果。人类的平均处理效应,五次都落在专家预测的 95% 区间里。孪生的处理效应,有三次落在外面。

和需要真答案的模型比,只取样本量大于 650 的 106 个结果。XGBoost 用同一套全人格特征,再看一部分人在这道题上的真实作答,训练人数从 50 加到 650。加到 650,相关仍然低于 0.29。全人格孪生不看这道题的任何答案,相关大约相当于用 180 个人的该题答案训出来的 XGBoost。只给人口学时,大约相当于 225 人。准确率上,孪生只相当于大约 75 份该题真答案。

领域上,认知题、人和技术的交互、用量表作答的题,相关更高。冲突、亲社会、社会认知和人格也偏高。社会期许很显眼的题、选举和公共议题、带褒贬的评价,以及题目在被试之间不一样时,相关更低。

为什么重要

拿合成被试替代问卷之前,先把 0.748 对着基线看:它只比空提示高 0.014。排序有一点,r 约 0.20。500 道题没有把这个人的分数钉住。

天花板更低。同一批档案交给 XGBoost,再让它看这道题上最多 650 个人的答案,相关仍低于 0.29。缺口不全在语言模型不会用特征,也在这些用了几十年的量表预测不了新情境。扫过的 GPT-5 和 Gemini-3 Pro 没有改掉这个格局。

孪生更像一份带着基座模型口味的比较画像,可以粗排谁更可能接受某项安排,不能当替身。把它当成知道得更多、也更按规范行事的顾问,比当克隆靠谱。Hugging Face 上的 Twin-2K-500-Mega-Study 可以当后续管线的考场。

局限与存疑

只测了一种造法:公开问卷塞进上下文。两小时访谈和闭源产品的微调没有直接打。Twin-2K-500 大约 1.5 万次下载,是最能复现的公开方案,所以结论落在这套方案上,落不到所有叫数字孪生的产品。

五处歪是探索性的。预注册了指标和 31 项高层比较,没有预注册一定是这五种。正文用一部分子研究说明偏向,31 项的效应量没有逐条列出,「偏向人好、偏向技术」是标出的模式,不是算完的总账。

个体准确率容易被读成已经 75%。随机基线 0.629,空模型 0.734,该引用的是相关 0.20。样本是美国 Prolific 面板,外人拿不到平台 ID,不能再招同一批人。Centaur 更差,也不能直接说行为微调的底座没用,格式和分布外都没控干净。

术语

原文与代码

社区讨论

全部论文解读