Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking
Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik
cs.AI, cs.CL, cs.LG
2026-08-15
把多轮信息获取写成 k-欠定约束满足问题,构建 5,251 题、9,006 实例的 MT-InfoSeek:模型知道该问,但低估缺失程度约 4 倍,k=2 时最小充分集识别无一超过 0.4。
用户丢来一句「订一张周三去北京的机票」,一个称职的助手应该发现缺信息:几点的航班?经济舱还是商务舱?用什么证件?它得先知道自己缺什么,再问对问题,问够了才回答。现有 benchmark 测的都是「给你完整上下文你答得多准」,多轮主动问信息这件事没有被形式化地测过:模型知道自己缺信息吗?缺多少?知道该问哪几个吗?问的顺序对结果有影响吗?
QuestBench 一类的数据集只缺一个变量,模型补一个数就完事,测不出多轮信息获取的真实难度。这篇把这件事写成 k-欠定约束满足问题:目标答案 Y 由一组变量决定,当前观测只固定了其中一部分,把答案唯一确定下来还差 k 个变量的值。k 越大,缺失的信息越多。这样「该问什么、该问几次」第一次有了可精确计算的 ground truth。
MT-InfoSeek 包含 5,251 个问题、9,006 个任务实例,横跨五个领域。四个结构化领域里可查询的变量集合是预先定义好的,模型每轮从中选一个问;构造时从完整状态里遮掉变量,并验证被遮掉的集合恰好是一个最小充分集(k-MSS,即任何更小的子集都不足以确定答案):
评测沿三条轴。何时问(k 预测):让模型估计缺失程度,报出高估/低估率。问什么(k-MSS 识别):让模型选出最小充分集,报精确匹配率和 Jaccard 相似度。问了有没有用(顺序解题):真跑多轮交互,每轮问一个变量。这里的关键设计是区分两个指标:最终准确率(答案对不对)和最终充分性(拿到的信息是否已唯一确定答案)。充分性在答案生成之前判定,把「不会找信息」和「不会算答案」拆开了。
k 增大,所有模型、所有领域都退化。具体到几个关键读数:
| 现象 | 数字 |
| 把欠定问题误判为信息完整(k=0) | 仅 0.6±0.8% |
| k 预测准确率 | k≥2 时全部跌破 0.5 |
| k=2 逻辑题上,低估缺失程度 vs 高估 | 低估频率约 4 倍于高估 |
| MSS 精确识别(不给 k) | k=2 时无一超过 0.4,k=3 时无一超过 0.2 |
| 给出真实 k 之后 | 只有边际改善 |
模型知道要问,但系统性低估要问多少、选不准最小集合,还常常在信息不足时就停手作答。在 ClinGuide-MT 上,模型沿诊断路径顺序推进的表现明显好于乱问,说明依赖结构本身可学;但有顺序依赖的任务里,问错顺序会连累最终准确率,即使最终该拿的信息都拿到了。
20Q 域用 nEIG(归一化期望信息增益)给模型自拟的问题打分:高分问题与人类盲评偏好的一致率 76.5%(200 对,高置信标注下 86.5%)。但提问信息量相近的模型,最终准确率差得很远,进一步印证「会问」和「会答」是两种能力。
对做 agent 和对话系统的人,这篇给了一个可直接复用的诊断框架。多数产品里的「澄清式追问」目前靠 prompt 硬凑,这篇的量化结果解释了为什么硬凑不稳定:模型对缺失程度的估计本身就有系统性偏差,给定 k 都未必选得对问题集合。final sufficiency 这个指标设计得聪明,它把信息获取从答案生成里剥出来单独计分,现有以准确率为主的评测体系量不到这个维度。五个领域覆盖数学、逻辑、生物、医学、开放问答,代码和数据公开的话可以直接接进自家模型的回归测试。
作者自己列的:用户模型是理想化的,真实用户会给出含糊、噪声、前后矛盾的回答;只处理「缺变量值」,不处理缺规则、缺约束;假设每次查询代价相同,而现实中问病人病史和做一次穿刺的代价天差地别。ClinGuide-MT 和 20Q 的应答方是 LLM 扮演的 oracle,作者做了一致性检查认为 oracle 不是失败主因,但没有人工审计协议。另外 GSME-Q-MT 原始构造被自家模型做穿了,说明这类合成数据的难度校准很脆弱,增强版能撑多久存疑。