Google 开源 Fuse:多智能体模拟评估 LLM 社交推理
google · hf · 2026-09-19
Google 发布论文 Fuse,一个用于研究「用户中介社交推理」的多智能体模拟框架。
动机:LLM 助手常被用于日常社交建议,但社交推理评估很难,因为情境来自用户主观叙述,且他人意图等社交属性缺乏可验证的真值。
方法:在 Fuse 中,一个带有隐藏动机的目标智能体与其他智能体(包括代表用户的智能体)交互,随后用户向被评估的助手咨询以推断目标动机——由于动机是构造时设定的,天然具备可验证真值。模拟保真度通过 24k 条人工标注的人类研究验证。
对 12 个 LLM 的实验发现:
- 用户中介会加剧社交推理的固有难度
- LLM 对带有偏见的用户叙述框架表现出系统性敏感
- 模型做出正确预测所需的信息可能多于人类
- 更长的对话并不总能提升表现,尽管提供了澄清提问的机会
Fuse 框架与包含 21k 样本的数据集已开源。
所属事件:Google 开源 Fuse 框架检验 LLM 社交情境推理能力(2 条相关)→
「模型」频道最新
- Burkov 提醒:闭源模型思考 token 不透明,计费可能被夸大 — burkov · 2026-09-19
- DiffusionGemma 原生视觉塔实现在手机上近实时目标检测 — bodonoghue85 · 2026-09-19
- 爆料称 DeepSeek v4.1 能自建训练任务并大规模验证 — teortaxesTex · 2026-09-19
- ChatGPT 发明者推出新型 AI 模型 Jev,开发者趋之若鹜 — TechCrunch AI · 2026-09-19
- 实测质疑 Jev 准确性:60% 正面硬币被答成 99/1 — JnBrymn · 2026-09-19
- 实测模型概率判断翻车:60/40 的硬币被说成 99/1 — JnBrymn · 2026-09-19