研究揭示:提问顺序影响 AI 诊断准确率,最终准确率不反映信息获取

marinkazitnik · x · 2026-08-19

一项由哈佛医学院、Broad Institute、Kempner Institute 和 Google DeepMind 合作的研究,将多轮信息寻求形式化为 k-欠约束约束满足问题,并构建了 MT-INFOSEEK 基准,包含 5,251 个问题和 9,006 个任务,涵盖数学、逻辑、基因调控、临床决策路径和 20 个问题。关键发现:1. 模型能检测到信息缺失;2. 提问顺序很重要,错误的第一个问题即使后续获取所有变量也会降低最终准确率;3. 最终准确率不能衡量信息寻求能力,模型可能在未获取足够信息时给出看似合理的答案。

所属事件:研究称大模型严重低估信息缺失量,提问顺序影响诊断准确率(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →