BehaviorBench:20 场景评测前沿模型的人类行为理解力

Scobleizer · x · 2026-10-09

密歇根大学与斯坦福等机构发布 BehaviorBench,在 20 个场景、4 项能力上系统评测基础模型对人类行为的理解,并同时发布配套行为科学专用模型 BeFM1.5(4B 与 70B 两个尺寸)。\n\n- 评测在个体层与群体分布层两个级别进行,并提供排行榜(Mean Win Rate / ELO 两种排名方式)\n- 涉及推理模型时标注了所用的 reasoningeffort 档位\n- 论文、数据集、代码与 BeFM 对话入口均已公开

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →