克利夫兰诊所本地Llama-3-8B抽13万肾癌病历,一致率97.5%

2026-08-27

克利夫兰诊所把Llama-3-8B部署在院内,用分支prompt从8366名肾切除患者的13万份文书抽出14类字段,与人工库总一致率97.5%,10个字段的仲裁更常站模型一边。

这篇在解决什么

临床研究库的金标准仍是人工从电子病历里扒字段。文献里单份病历平均要 30 分钟以上,人一累就错,不同抽取员之间的不一致被报到过 10%、26%,高的到 42%。规模一大就做不动。

闭源大模型能抽字段,但病历是受保护健康信息,送到院外服务器过不了治理关。克利夫兰诊所泌尿外科 AIM-HI Lab 和 IBM Research Israel 要验证的是:开源小模型、院内部署、加上按文书类型写的 prompt 和分支逻辑,能不能在真实肾癌队列上重建一份能用的多域数据库。

方法

模型选 Llama-3-8B,理由是性能和本地硬件的折中,从 Hugging Face 下载,A100 上跑 FP16,能批处理就批处理。数据从 Epic 的 Clarity 库出,按 CPT 代码纳入 2009 年 10 月到 2024 年 7 月在该医疗系统做过部分或根治性肾切除的患者,上尿路上皮癌的肾输尿管切除也算。IRB 号 23-1158,最小风险、豁免知情同意。

流水线分四步:

验证用院内既有人工库当参照。人工缺失的点不进比较。分类变量看一致率和 Cohen's κ,连续变量看组内相关系数 ICC。不一致的条目由盲法第三方按每字段随机 50 条(不足 50 则全裁)裁定谁对。

结果

模型抽了 9095 人,其中 8366 人在人工参照库里有对应记录。队列平均年龄 62.8 岁,男性 63%,白人 84%,部分肾切除 57.1%,透明细胞肾细胞癌 51.2%。130,509 份文书(人均 15.6 份)抽出 136,425 个字段,总一致率 97.5%,逐字段从 74.2% 到 99.5%。

字段一致率κ 或 ICC文书类型
横纹肌样特征99.46%κ=0.94病理
孤立肾99.01%κ=0.36放射
肉瘤样特征98.82%κ=0.91病理
组织学亚型98.76%κ=0.94病理
pT 分期98.58%κ=0.95病理
核分级98.03%κ=0.95病理
病理大小89.15%ICC=0.92病理
缺血类型(冷 / 热)74.67%κ=0.65手术

病理类字段大多超过 98%,κ 大于 0.90。弱项集中在手术记录里的缺血类型和病理大小。孤立肾一致率极高但 κ 只有 0.36,因为队列里孤立肾不到 0.1%,靠碰运气也能对上。切缘状态同样是高一致率、低 κ(93.09%,κ=0.55)。估计出血量一致率 91.61%,ICC=0.71。

时间上,2009 年一致率 84.2%,2023 年 97.8%,作者将其归因于报告模板逐渐标准化。

2.5% 的不一致里,人工仲裁更常站 LLM 一边的字段有 10 个;人工更常对的是病理大小、pN、肉瘤样特征和缺血类型。病理大小的典型错法是报告里没有三个径,模型把覆盖脂肪的尺寸当成肿瘤径;pN 则是报告没写分期时,模型把 pN0 写成 pNX。

文书中位长度 2722 字符,单份平均 14.5 秒。手术记录来自 6 家医院、162 名术者。7 张 A100 跑完全队列 82.1 小时,约每份病历 35 秒。按每份 30 分钟估,一个全职人员要两年。

为什么重要

这是目前公开文献里、按患者数和字段宽度都偏大的一份经过人工对照的 LLM 抽库。它证明的不是「GPT-4 能抽病历」,是 8B 开源模型、院内部署、分支 prompt,在跨医院、跨十年、上百名医生的真实文书上能打平、并在多数争议字段上打赢人工。对要建专病库、又过不了数据出境关的医院,这条路径比调商业 API 更可执行。

代价也清楚:prompt 是临床专家反复打磨的,换病种、换医院几乎肯定要重做验证。作者自己把高分首先记在迭代 prompt 和分支设计上,而不是模型规模。

局限与存疑

单中心、外科队列,没有按医院或地区拆开报准确率。纵向结局(复发、进展、治疗反应)还没抽。Llama-3-8B 偏小,更大或医学专用模型会不会更好,这篇没有比。仲裁只做了不一致条目的随机子集,而且不是双人独立裁决,「谁才是金标准」这个问题没有完全闭合。人工库本身缺测不少,一致率是在两边都有值的子集上算的。

标题写「人工审阅的末日开端」,证据撑到的是:在这份肾癌手术库上,本地 8B 模型已经能替代大部分基线字段抽取。它替代不了临床专家写 prompt,也还没碰到随访结局这种更脏的文本。

术语

原文与代码

社区讨论

全部论文解读