MIT 学者质疑 Aaru 人类模拟评测:方法不透明、缺基线、疑数据泄漏

soumitrashukla9 · x · 2026-09-27

LLM 人类模拟初创公司 Aaru 宣布在 2,993 个问题上取得行业领先的评估成绩(平均 TVD 7.62%、MAE 3.53%),称模拟有望变革社会研究。MIT 学者 Andrey Fradkin 用 ChatGPT 与 Refine 充当“AI 审稿人”复核后指出多项问题:Aaru 方法论不透明、缺乏必须跨过的基线模型门槛、存在潜在数据泄漏、统计声明和与已发表文献的对比缺乏依据。他认为在经过同行评审或外部压力检验之前,对该结果应保持怀疑。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →