清华等提出“代表性平等”指标,揭示 LLM 模拟不同国家人群的偏见
zibuyu9 · x · 2026-08-21
清华大学等机构在《Computational Linguistics》发表研究,探讨 LLM 作为人类代理在跨国调查中的表现。论文引入了“代表性平等”概念及指标 EqCV,测试了 9 个开源模型在 59 个国家和 2420 个子群体中的表现。研究发现,模型准确率与平等性不同:GLM-4-9B 准确率最高(0.739)但平等性较差,而 ChatGLM3-6B 在平等性和综合 AE 分数上领先。这表明高平均性能并不意味着对不同人群的公平覆盖。
「研究」频道最新
- Nature 研究:AI 抗体生成面临泛化难题 — anshulkundaje · 2026-08-21
- 语义缓存实测:重写劣质缓存不如直接丢弃 — Reasonable_Royal_621 · 2026-08-21
- 统计模拟难做?Ian Arawjo发推吐槽 — IanArawjo · 2026-08-21
- 教你自制遇光变蓝的光致变色系统 — johnowhitaker · 2026-08-21
- Kaggle 推出对抗性客户服务基准,测模型防欺诈能力 — MeganRisdal · 2026-08-21
- 研究提出上下文持续学习需动态压缩信息 — HanGuo97 · 2026-08-21