Google 论文 Fuse:模拟构建基准,测 12 个 LLM 的社交动机推断力
dair_ai · x · 2026-09-16
dair-ai 推荐了一篇 Google Research 论文,研究 LLM 助手如何推理用户生活中的人际关系。人们经常向助手寻求社交建议,但助手只听到用户一方的叙述;衡量它是否正确理解局面很难,因为他人意图没有 ground truth。
Fuse 方法用模拟构建基准:
- 一个带有隐藏动机的目标智能体与其他智能体(含一个扮演用户的)交互
- 用户智能体把经过自身视角加工的事件描述给助手,助手需推断隐藏动机
评测:
- 用 2.4 万条人类标注验证模拟的有效性
- 测试了 12 个 LLM
发现:仅通过用户的转述听事件使任务更难;用户的偏向性框架会改变助手的回答;模型有时比人类需要更多细节;留有澄清问题空间的长对话并未让推理变容易。
「研究」频道最新
- 复旦团队:LLaMA3-70B与Qwen25-72B可无人工干预自我复制 — hey_abusiddik · 2026-09-16
- 贝壳开源 PanoWorld:户型图驱动生成全屋一致 3D 全景 — rsasaki0109 · 2026-09-16
- 博主借 Wheeler 案警示:模型自评自测时「通过」意义存疑 — vishalmisra · 2026-09-16
- 从 Thompson 编译器攻击看 AI 评测:模型参与评测,验证即失效 — vishalmisra · 2026-09-16
- 普林斯顿 Hazan 撰文回顾在线凸优化二十年发展史 — HazanPrinceton · 2026-09-16
- 用实验室私有数据 RL 预测实验结果,杜绝网络预训练污染 — hsu_byron · 2026-09-16