MIT economist challenges Aaru's human-simulation benchmarks: opaque method, no baseline, data leakage risks

soumitrashukla9 · x · 2026-09-27

LLM human-simulation startup Aaru claimed industry-leading results across 2,993 questions (mean TVD 7.62%, MAE 3.53%). MIT economist Andrey Fradkin ran the analysis past ChatGPT and Refine as AI referees and flagged opaque methodology, no baseline-model hurdle, potential data leakage, and unjustified statistical claims. Until peer review forces the authors to address these, skepticism is warranted.

Original post →

More from Research

Research channel →