BehaviorBench:20 场景评测前沿模型的人类行为理解力
Scobleizer · x · 2026-10-09
密歇根大学与斯坦福等机构发布 BehaviorBench,在 20 个场景、4 项能力上系统评测基础模型对人类行为的理解,并同时发布配套行为科学专用模型 BeFM1.5(4B 与 70B 两个尺寸)。\n\n- 评测在个体层与群体分布层两个级别进行,并提供排行榜(Mean Win Rate / ELO 两种排名方式)\n- 涉及推理模型时标注了所用的 reasoningeffort 档位\n- 论文、数据集、代码与 BeFM 对话入口均已公开
「研究」频道最新
- Meta 发布 RoboJEPA:8B 参数机器人世界模型,首提多具身 scaling law — meta · 2026-10-09
- 零人工标注:自动生成足球球员追踪数据集,HOTA 达 62.5 — RexDouglass · 2026-10-09
- LLM 为什么不真正"读字":从 BPE 到字节级模型的tokenization脉络 — jbhuang0604 · 2026-10-09
- PyTorch + KV 缓存加速 HSTU 推荐模型,延迟最高降 5.93 倍 — PyTorch · 2026-10-09
- 新预印本:LLM 把数字存成曲线和螺旋,但计算时并非总用这些形状 — tweetsatpreet · 2026-10-09
- 669 项临床决策仅花 1.7 美分,开源模型医疗成本惊人 — antoine_chaffin · 2026-10-09