研究揭示:提问顺序影响 AI 诊断准确率,最终准确率不反映信息获取
marinkazitnik · x · 2026-08-19
一项由哈佛医学院、Broad Institute、Kempner Institute 和 Google DeepMind 合作的研究,将多轮信息寻求形式化为 k-欠约束约束满足问题,并构建了 MT-INFOSEEK 基准,包含 5,251 个问题和 9,006 个任务,涵盖数学、逻辑、基因调控、临床决策路径和 20 个问题。关键发现:1. 模型能检测到信息缺失;2. 提问顺序很重要,错误的第一个问题即使后续获取所有变量也会降低最终准确率;3. 最终准确率不能衡量信息寻求能力,模型可能在未获取足够信息时给出看似合理的答案。
所属事件:研究称大模型严重低估信息缺失量,提问顺序影响诊断准确率(3 条相关)→
「研究」频道最新
- 观点:技能优化只是 prompt 优化的新包装 — IanArawjo · 2026-08-19
- NBER 研究:Pangram 检测器误报率接近零 — soumitrashukla9 · 2026-08-19
- AI 风险真相:失控的权限比模型能力更致命 — bigdata · 2026-08-19
- 4300 个真实编码 Agent 会话实测:缓存命中高但成本仍平方级增长 — CShorten30 · 2026-08-19
- 贝叶斯观点赢得了 AI 辩论,却鲜有人察觉 — AdaptiveAgents · 2026-08-19
- 技术讨论:过确定投影在表示学习中可能优于任意嵌入表 — kalomaze · 2026-08-19