MIT 学者质疑 Aaru 人类模拟评测:方法不透明、缺基线、疑数据泄漏
soumitrashukla9 · x · 2026-09-27
LLM 人类模拟初创公司 Aaru 宣布在 2,993 个问题上取得行业领先的评估成绩(平均 TVD 7.62%、MAE 3.53%),称模拟有望变革社会研究。MIT 学者 Andrey Fradkin 用 ChatGPT 与 Refine 充当“AI 审稿人”复核后指出多项问题:Aaru 方法论不透明、缺乏必须跨过的基线模型门槛、存在潜在数据泄漏、统计声明和与已发表文献的对比缺乏依据。他认为在经过同行评审或外部压力检验之前,对该结果应保持怀疑。
「研究」频道最新
- 开源 AI-SQL 引擎 Quail 单块 H100 跑出每分钟 10 亿 token — sh_reya · 2026-09-27
- Linzen 晒两篇论文反驳 Bender:工具调用让「大模型无语义」论失效 — tallinzen · 2026-09-27
- DeepMind 研究员批评论文作者无视实证证据,拒绝根据新证据修正立场 — AndrewLampinen · 2026-09-27
- 谷歌研究员 Lampinen 长文反驳「随机鹦鹉」:纯语言训练也能学到意义 — AndrewLampinen · 2026-09-27
- 小米发布 MiMo-V2.6 论文:用强化学习规模化冲击 LLM 核心 — KyeGomezB · 2026-09-27
- 大脑是预测机器:失去现实纠偏信号就会开始幻觉 — alfcnz · 2026-09-27