研究称大模型严重低估信息缺失量,提问顺序影响诊断准确率
哈佛医学院、Broad Institute、Kempner Institute 与 Google DeepMind 合作的新研究将多轮信息寻求形式化为 k-欠定约束满足问题,并构建了覆盖数学、逻辑等领域的 MT-INFOSEEK 基准。研究发现大模型虽能察觉信息不足,但在量化缺失程度时严重低估;同时提问顺序会影响 AI 诊断准确率,且最终准确率并不能反映信息获取过程的质量。研究还探讨了模型在信息不足时应向人类反问什么的问题。
2026-08-19 ~ 2026-08-19 · 3 条相关
- 新研究:LLM 能否识别缺失信息并反问? — marinkazitnik · 2026-08-19
- 论文揭示 LLM 严重低估信息缺失量 — marinkazitnik · 2026-08-19
- 研究揭示:提问顺序影响 AI 诊断准确率,最终准确率不反映信息获取 — marinkazitnik · 2026-08-19