Google 论文 Fuse:模拟构建基准,测 12 个 LLM 的社交动机推断力

dair_ai · x · 2026-09-16

dair-ai 推荐了一篇 Google Research 论文,研究 LLM 助手如何推理用户生活中的人际关系。人们经常向助手寻求社交建议,但助手只听到用户一方的叙述;衡量它是否正确理解局面很难,因为他人意图没有 ground truth。

Fuse 方法用模拟构建基准:

评测:

发现:仅通过用户的转述听事件使任务更难;用户的偏向性框架会改变助手的回答;模型有时比人类需要更多细节;留有澄清问题空间的长对话并未让推理变容易。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →