MIT 斯坦福等共建 Social Simulation Arena,为社会模拟建立前瞻性统一评测
_Hao_Zhu · x · 2026-09-15
来自 MIT、Stanford、Harvard、CMU、UC Berkeley 等机构的研究者推出了 Social Simulation Arena,试图解决社会模拟领域缺乏统一评测标准的问题。
- 现状:各家模拟器(persona 提示人群、数字孪生、十亿级 agent 世界等)都用自有数据集评测,且常用答案早已公开的历史调查数据,「背过答案」的模型可以表现得很漂亮。
- 方案:Arena 是前瞻性、独立、共享的测试——参赛模拟器在真实数据发布前提交并锁定预测,真实结果公布后按统一规则打分。
- 核心问题:能否判断哪个社会模拟器真正可靠,目前仍无公认标准。
「研究」频道最新
- 递归循环 Transformer 实现无限推理深度,代码开源 — 141_1337 · 2026-09-15
- arXiv 拟推「口试」审查?学者热议 AI 代写投稿乱象 — RishiBommasani · 2026-09-15
- Jay Alammar PyData 演讲:读懂 agent 基准分数的十个关键问题 — JayAlammar · 2026-09-15
- RLE-Bench 出炉:48 项任务评测 LLM 机器人工程能力不止于控制 — daibond_alpha · 2026-09-15
- BrainGPT 作者:AI 科学发现将复杂到「像对狗讲量子力学」 — every · 2026-09-15
- Ethan Mollick 用 GPT 试译线形文字A,自嘲那是 researchslop — emollick · 2026-09-15