2026-08-27
克利夫兰诊所把Llama-3-8B部署在院内,用分支prompt从8366名肾切除患者的13万份文书抽出14类字段,与人工库总一致率97.5%,10个字段的仲裁更常站模型一边。
临床研究库的金标准仍是人工从电子病历里扒字段。文献里单份病历平均要 30 分钟以上,人一累就错,不同抽取员之间的不一致被报到过 10%、26%,高的到 42%。规模一大就做不动。
闭源大模型能抽字段,但病历是受保护健康信息,送到院外服务器过不了治理关。克利夫兰诊所泌尿外科 AIM-HI Lab 和 IBM Research Israel 要验证的是:开源小模型、院内部署、加上按文书类型写的 prompt 和分支逻辑,能不能在真实肾癌队列上重建一份能用的多域数据库。
模型选 Llama-3-8B,理由是性能和本地硬件的折中,从 Hugging Face 下载,A100 上跑 FP16,能批处理就批处理。数据从 Epic 的 Clarity 库出,按 CPT 代码纳入 2009 年 10 月到 2024 年 7 月在该医疗系统做过部分或根治性肾切除的患者,上尿路上皮癌的肾输尿管切除也算。IRB 号 23-1158,最小风险、豁免知情同意。
流水线分四步:
验证用院内既有人工库当参照。人工缺失的点不进比较。分类变量看一致率和 Cohen's κ,连续变量看组内相关系数 ICC。不一致的条目由盲法第三方按每字段随机 50 条(不足 50 则全裁)裁定谁对。
模型抽了 9095 人,其中 8366 人在人工参照库里有对应记录。队列平均年龄 62.8 岁,男性 63%,白人 84%,部分肾切除 57.1%,透明细胞肾细胞癌 51.2%。130,509 份文书(人均 15.6 份)抽出 136,425 个字段,总一致率 97.5%,逐字段从 74.2% 到 99.5%。
| 字段 | 一致率 | κ 或 ICC | 文书类型 |
| 横纹肌样特征 | 99.46% | κ=0.94 | 病理 |
| 孤立肾 | 99.01% | κ=0.36 | 放射 |
| 肉瘤样特征 | 98.82% | κ=0.91 | 病理 |
| 组织学亚型 | 98.76% | κ=0.94 | 病理 |
| pT 分期 | 98.58% | κ=0.95 | 病理 |
| 核分级 | 98.03% | κ=0.95 | 病理 |
| 病理大小 | 89.15% | ICC=0.92 | 病理 |
| 缺血类型(冷 / 热) | 74.67% | κ=0.65 | 手术 |
病理类字段大多超过 98%,κ 大于 0.90。弱项集中在手术记录里的缺血类型和病理大小。孤立肾一致率极高但 κ 只有 0.36,因为队列里孤立肾不到 0.1%,靠碰运气也能对上。切缘状态同样是高一致率、低 κ(93.09%,κ=0.55)。估计出血量一致率 91.61%,ICC=0.71。
时间上,2009 年一致率 84.2%,2023 年 97.8%,作者将其归因于报告模板逐渐标准化。
2.5% 的不一致里,人工仲裁更常站 LLM 一边的字段有 10 个;人工更常对的是病理大小、pN、肉瘤样特征和缺血类型。病理大小的典型错法是报告里没有三个径,模型把覆盖脂肪的尺寸当成肿瘤径;pN 则是报告没写分期时,模型把 pN0 写成 pNX。
文书中位长度 2722 字符,单份平均 14.5 秒。手术记录来自 6 家医院、162 名术者。7 张 A100 跑完全队列 82.1 小时,约每份病历 35 秒。按每份 30 分钟估,一个全职人员要两年。
这是目前公开文献里、按患者数和字段宽度都偏大的一份经过人工对照的 LLM 抽库。它证明的不是「GPT-4 能抽病历」,是 8B 开源模型、院内部署、分支 prompt,在跨医院、跨十年、上百名医生的真实文书上能打平、并在多数争议字段上打赢人工。对要建专病库、又过不了数据出境关的医院,这条路径比调商业 API 更可执行。
代价也清楚:prompt 是临床专家反复打磨的,换病种、换医院几乎肯定要重做验证。作者自己把高分首先记在迭代 prompt 和分支设计上,而不是模型规模。
单中心、外科队列,没有按医院或地区拆开报准确率。纵向结局(复发、进展、治疗反应)还没抽。Llama-3-8B 偏小,更大或医学专用模型会不会更好,这篇没有比。仲裁只做了不一致条目的随机子集,而且不是双人独立裁决,「谁才是金标准」这个问题没有完全闭合。人工库本身缺测不少,一致率是在两边都有值的子集上算的。
标题写「人工审阅的末日开端」,证据撑到的是:在这份肾癌手术库上,本地 8B 模型已经能替代大部分基线字段抽取。它替代不了临床专家写 prompt,也还没碰到随访结局这种更脏的文本。