研究:LLM 调查响应虽似真但缺乏心理测量效度
Mantas Lukauskas · hf · 2026-08-18
这项研究对大语言模型作为合成调查受访者的适用性进行了心理测量审计。结果显示,虽然 LLM 能在合成响应中复制广泛的心理测量趋势,但在匹配人类联合分布、信度和中介结构方面表现失败。结论认为 LLM 目前尚不适合替代真实受访者进行严谨的社会科学调查。
「研究」频道最新
- 计算机使用数据集超 5 万小时,含键鼠操作 — DevvMandal · 2026-08-18
- Devv 发布 5 万小时计算机使用数据集 — DevvMandal · 2026-08-18
- 回应基准测试:这可能是为了刷榜 — sudoraohacker · 2026-08-18
- 评论 AI 生成低质量论文:无人理解且破坏学术激励 — thegautamkamath · 2026-08-18
- AI 辅助治疗男性不育,无精症中精子找回率达 26% — EricTopol · 2026-08-18
- 新基准 MazeBench 揭露顶尖 Agent 难以通过基础 3D 关卡 — xeophon · 2026-08-18