2026-08-21
清华等在59国、9个开源模型上测「代表性平等」。平均准确0.538–0.739,越富越准。补背景信息比母语提示或偏好对齐更能同时抬准、拉平。
用LLM扮演各国人群、复现价值观分布,已经是计算社会科学的常用捷径。平均准不等于各国一样准。模拟能力如果集中在北美、欧洲、澳新,下游的舆论实验和政策推演会把欠表征国家的声音压扁,甚至把它们拉向美国式回答。
清华新闻学院、复旦、南开、上交和清华计算机把这件事收成一个可比较的指标:代表性平等,问的不是模型该不该给出相同答案,而是各国的模拟准确度是否处在同一水平。评测覆盖世界价值观调查第七波中59个国家、2420个国家–人口子群、160道共享选择题。
模拟用首token概率:对每道多选题取前20个首位置token,留下选项字母并归一化,得到模型对子群的回答分布。准确度是1减去该分布与人类分布的Jensen–Shannon散度,先在11个价值维度内平均再跨维度平均,避免题多的维度抢走总分。
国家层面的代表性平等主指标是准确度的变异系数EqCV,越低越均匀;同时报最大最小差、最小最大比和基尼系数,附录里四套指数结论一致。再加一个复合分AE,取平均JSD与EqCV的几何平均,既准又匀才低。
干预分两条路。语境适应:用中文、阿拉伯语、西班牙语母语提示,或从非目标WVS题检索三条经验分布当「历史记忆」。参数修改:评SambaLingo在阿拉伯语等六种语言上的持续训练,以及用人类或GPT标注的HH-RLHF做DPO/GRPO对齐。九个开源模型从ChatGLM3-6B到Qwen2.5-72B。
国家平均准确度从0.538到0.739。GLM-4-9B最高,两个小Qwen垫底。EqCV从0.0286(ChatGLM3-6B)到0.0546(Qwen2.5-72B)。GLM-4-9B虽最准,EqCV仍有0.0486。复合分AE反过来:ChatGLM3-6B最好(0.096),GLM-4-9B 0.113,Mistral-7B 0.116。最准的模型不是最匀的。
准确度与人均GDP、互联网使用、全球创新指数、治理指标正相关,与权力距离负相关,与个人主义、放纵正相关。地图上澳新、北美、欧洲更红,埃及、约旦、伊拉克更淡。案例里,伊拉克对「完全信任家人」超过95%,美国约60%,GLM-4-9B给两国都预测在40%附近,半数以上题目的伊拉克模拟更靠近美国真人分布。
母语提示多数能抬准,但不稳。约旦在「自由还是安全」上真人90%选安全,Qwen2.5-72B英文提示100%押自由,阿语提示改成79.2%选安全。增益若集中在某语种,不平等只是换了赢家。补背景信息更稳:几乎所有模型EqCV下降,GLM-4-9B在BM25下从0.0486降到0.0255。语言持续训练六组平均都涨,阿拉伯语从约旦-1.2%到摩洛哥+3.4%。偏好对齐没有系统增益,人类标注比GPT标注更能保住准确度。
做跨国舆论模拟、文化对齐评测,只报平均准确度会掩盖结构性偏倚。这篇把「各国准不准一样」变成可比较的指数,并拆开提示、检索、持续训练、对齐四条干预。想立刻改善跨国家平衡,给模型补子群背景比再做一轮偏好对齐更有效。这是评测论文,不提供新的训练算法。
主证据来自固定选项的标准化问卷,推不到开放讨论、道德推理或真实行为。国家作为比较单元会盖住国内差异和跨境语言少数群体。WVS各价值维度题量、抽象程度、翻译与社会期许效应并不齐,总体分数可能抹平维度差异。首token概率相对文本采样更便宜,附录显示两者一致,但仍是受约束选项空间里的近似。对齐实验换的是现成偏好数据,不是为价值模拟专门采集的。