八组LLM审查对临床遗漏近乎抛硬币,枚举事实才部分找回

LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes and What Recovers It

Sebastian Fox, Luke Markham, Ryan Lail, Michael Karotsieris

cs.CL, cs.AI

2026-08-31

对500对临床笔记做八组审查:增改内容配对区分0.79到0.94,遗漏只有0.50到0.63;先列转录事实再逐条核对,单条检出升到24.6%到36.9%。

这篇在解决什么

环境 AI 记录员已经在门诊里批量起草临床笔记。已发表的人工审计把遗漏标成主导错误类:问诊里已经确立、笔记没写进去的信息,占全部错误的 54% 到 86.3%。同期一份对三款上线产品、142 次问诊、565 份笔记的普查给出 31.3% 的笔记至少带一处已核实失败,最大一块是过敏和用药写丢或写错。

业界拿来撑规模的质检层是 LLM judge,第二个模型对照转录和笔记打问题。公开语料给不了答案键。PriMock57 的 53 份、ACI-Bench 的 45 份可用参考笔记,100% 都和自己的转录有实质出入,平均每份 10.7 和 7.1 处。拿这些参考笔记当金标准,等于把 7 到 11 个错误写进答案键本身。

方法

先从转录抽出事实表,经交叉模型审计后再改参考笔记,做成干净稿。再从干净稿里挖掉或改掉一条事实,得到 500 对单错误笔记(评估集 495 对、112 次问诊):293 对遗漏、202 对增改对照。遗漏按严重度和「事实还剩多少痕迹」分级:150 条彻底挖掉,86 条留碎片,57 条别处还留完整复述。

打分两套。配对区分问的是有错那份是否严格低于自己的干净孪生稿,0.500 是抛硬币;生产环境没有孪生稿,这只是能力天花板。单条检测才是部署指标:一份笔记进来,打不打标,必须跟干净稿上的误报率并排看。可用检测的口径是误报不超过 10%,且检出明显高于误报。

八组消融交叉三个选择:只查忠实度还是忠实度加完整性、是或否还是 0 到 10 分、问一次还是八次投票。另外还有生产忠实度审查、G-Eval、清单审查、手写强提示、RAGAS 风格逐条覆盖,以及两条真正改任务结构的路线。

结果

八组审查对增改内容配对区分 0.79 到 0.94,六组在 0.87 以上;对遗漏只有 0.50 到 0.63。最好的整体审查(忠实度加完整性、打分、八次采样)也只到 0.634。单条笔记上,八组都分不开漏写稿和完美稿,无阈值 AUC 在 0.503 到 0.575。改审查范围、答案格式、投票、措辞,再用 GEPA 搜提示,都只是沿着同一条弱曲线挪工作点,造不出可用的单条检测。

把「缺没缺」改成「这条事实在不在」之后,信号出现。

方法遗漏配对单条检出 / 误报每份成本
八组里最好0.6348.3% / 6.5%$0.036
流水线(任一关键事实缺失即标)0.79524.6% / 2.7%$0.45
演化提示(低于 10 分即标)0.67036.9% / 6.2%$0.046

流水线的旗标会点名缺了哪条、严重度、转录原句。医生作者在 10 份两套方法结论相反的笔记上全部站流水线(p=0.002)。机制拆开:把事实清单塞进整体审查大约只贡献三分之一的提升,封闭的逐条裁决贡献剩下的。推理预算能把普通整体审查的配对从 0.570 抬到 0.670,带清单再加高预算也只到 0.699,仍低于流水线的 0.786。

复述痕迹打垮所有可部署方法:主陈述删了、别处还留完整复述时,流水线规则 57 条里检出 0,演化提示 4 条。这类痕迹 90.2% 落在另一个小标题下。

真实厂商笔记上,基准阈值全部失效。重标定后,演化提示仍比最好的整体审查检出更高、误报大约一半;流水线打出的旗里,75.6% 点名的就是普查小组核实过的那条事实。

为什么重要

如果你在用 LLM 给 AI 记录员做质检,现在这层审查对主导错误类近乎瞎。改提示、加投票、上优化器都不够。任务要改成先列转录确立的事实,再对每条做存在核对,并且用逐条裁决而不是覆盖率均分来做笔记级决定。

两条可部署点各买一样东西。流水线贵、安静、旗标可执行,例如「核对克林霉素过敏有没有写」。演化提示便宜约一个数量级,检出更高,但旗只是一个低于 10 的分数,阈值还得在自家干净稿上重标定。覆盖率型流水线会放过编造,生产上要另挂忠实度审查。

这是渐进修复。最好也只抓住大约三分之一的漏写笔记。

局限与存疑

遗漏半边没有外部医生标注锚。MEDEC 能锚住增改,遗漏结果仍内生于这套自建工具。注入错误比真实失败干净,真实笔记上检出和误报都陡升,基准工作点不能直接搬。标题数字来自主模型家族;换家族后不对称仍在,单条检测强度会变。医生验证的评分者是作者本人,真正结构盲的阶段每组只有 6 到 20 条。语料限于英美初级和门诊护理,没有 EHR 结构化字段。作者以评估工具为业,推荐的流水线是自家设计,提示和判定已全部公开。

术语

原文与代码

社区讨论

相关论文

全部论文解读