Retrieval, not hallucinations, will be the limiting factor for LLM-based clinical AI tools
Kirk Roberts, Steven Bedrick, Kurt Miller, William R. Hersh, Hongfang Liu
cs.IR, cs.CL
2026-06-29
观点论文:临床 AI 的真瓶颈是检索召回(漏掉关键病史)而非幻觉,且召回错误没有等效的缓解手段。
临床 AI 的公开讨论几乎全在盯幻觉:模型编造了不存在的病史、给出了没有依据的诊断。这属于精度错误(说错了)。但这篇来自 UTHealth、OHSU、Mayo、UT Austin 的观点论文要纠偏:在需要先从电子病历里检索患者历史的 RAG 系统里,更危险、更被忽视的是召回错误(该捞的关键信息没捞上来,也就是遗漏)。
这是观点论文,没有新实验。作者借统计学的 type I(假阳性)/type II(假阴性)框架,把临床 LLM 工具的错误分成两类:精度错误是输出里有患者数据撑不起的内容(幻觉),召回错误是输出里漏掉了患者完整数据里本该有的关键信息。作者顺着这个框架,分析了两类错误的来源和各自的缓解办法。
召回错误有两个来源:检索系统没把关键信息返回(检索层召回失败),或者检索到了但模型生成时没写进去(生成层召回失败)。
论文给的不是跑分数字,是几条判断加一次小规模访谈。他们访谈的 8 位临床医生,全都主动把幻觉当成头号顾虑,没有一个人在被提示前想过召回错误;提示之后,所有人都同意召回错误同样严重。
核心论点是:幻觉能靠「让模型附上来源链接、医生去核对」缓解,召回错误没有等效手段,唯一的兜底是医生人工通读完整病历,而这恰恰抹掉了用 AI 省时间的初衷。在大规模数据上,一个系统的真实召回率根本测不准,只能估个上界,所以召回错误「可能真的是个沉默的杀手」。
对做医疗 AI 的人,这是个提醒:把全部精力花在压低幻觉上,可能是在解错题。检索这一环(能不能把分散在超长、结构复杂的病历里的关键事实捞全)才是更难、更隐蔽的瓶颈,而且它随病历互联互通、数据量增长只会更严重。论文也顺带指出,检索技术的进步一直慢于 LLM 本身的进步。
作者自己坦白 type I/II 框架不能完美套到生成式输出上,因为模型输出是整段话,可能以多种方式出错。他们也承认没有大规模研究能证实召回错误的影响有多大,原因正是召回本身难测。在公开 EHR 数据(如 MIMIC)上做的检索基准,未必能 generalize 到各家医院自己的数据;而用 LLM 当 judge 去评估检索,等于「检索和评估是同一个问题」,只能当个近似。