清华等提出“代表性平等”指标,揭示 LLM 模拟不同国家人群的偏见

zibuyu9 · x · 2026-08-21

清华大学等机构在《Computational Linguistics》发表研究,探讨 LLM 作为人类代理在跨国调查中的表现。论文引入了“代表性平等”概念及指标 EqCV,测试了 9 个开源模型在 59 个国家和 2420 个子群体中的表现。研究发现,模型准确率与平等性不同:GLM-4-9B 准确率最高(0.739)但平等性较差,而 ChatGLM3-6B 在平等性和综合 AE 分数上领先。这表明高平均性能并不意味着对不同人群的公平覆盖。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →