NIH五步工作流给医学LLM入门:从拆任务到部署,GPT-5 MedQA 95.8%

2026-09-03

NIH NLM 在 Nature Protocols 给出医学 LLM 五步工作流:拆任务、选模型、提示、微调、部署。汇编表里 GPT-5 的 MedQA 为 95.8%,配套代码用临床试验匹配演示。

这篇在解决什么

医院和实验室里用 LLM 的常态,还是对着聊天框随手打一句。NIH 国家医学图书馆(NLM)带队、多所美国高校参与的这篇 Nature Protocols 教程认定:这种用法在医学任务上不够,既浪费能力,也容易用错,最后可能伤到病人。

缺的是能照着做的操作手册,不是又一篇能力综述。要回答的是:一个医学需求怎么变成模型接得住的任务,模型怎么选,提示怎么改,什么时候才该微调,上线要过哪些合规和公平性门槛。

方法

工作流拆成五步,每步配一条可执行的最佳实践,贯穿一张临床试验匹配的演示任务。

任务先归入五类:知识与推理、摘要、翻译、结构化抽取、多模态分析。建议先攒大约 100 条带输入输出的测试样本。推理类可以先对短答案(是/否)打分,过了再审解释;摘要和翻译用 BLEU、ROUGE、BERTScore 对照参考文本,但教程写明这些自动指标和人工判断经常对不上。

选模型看三件事。数据模态和上下文窗口是硬约束;医学能力用考题做初筛、用临床评估定案;接口在网页聊天、API、本地部署之间权衡。敏感数据走 HIPAA:OpenAI 公有 API 通常不合规,Azure 和 Anthropic 有合规托管,本地 Llama 或 Mistral 更可控。上下文用 PubMed 摘要做尺子:一篇大约 300–400 token,Llama 3.0 的 8k 窗口大约 20 篇,GPT-5 的 400k 大约 1600 篇,Claude 4.5 Opus 的 200k 大约 800 篇,Gemini 3.0 的 1M 大约 2500 篇。长窗口仍有 lost-in-the-middle,中间段落容易被丢掉。

提示工程默认温度 0、输出 JSON。few-shot 用 1–5 条多样本,从零样本往上加;默认让模型先逐步推理再给答案;知识过时或会编造就接 RAG 或工具调用。提示也可以交给 DSPy、TextGrad 这类程序化优化。微调只在三件事发生时考虑:提示改不动、训练数据已经很多、工作提示太长太贵。参数高效微调(PEFT / LoRA)适合小而专的数据;临床摘要的例子是几千条样本加一张 NVIDIA Quadro RTX 8000。

部署把输出定位成辅助工具,不是替代医生。上线后持续盯公平、偏见、成本和模型淘汰后的重验。

结果

这篇是协议教程,没有自己跑一套新的对照实验。核心产出是一张汇编的 MedQA-USMLE(四选一)对照表,加上临床试验匹配的配套代码。

模型权重上下文MedQA
GPT-5闭源400k95.8%
o1-preview闭源128k94.9%
Gemini 3.0 Pro闭源1M94.6%
DeepSeek-R1开源 671B128k92.0%
Claude 4.5闭源200k91.4%
Llama 3.1开源128k88.2%
Llama 2开源4k47.8%

数字来自文献和第三方榜单,不是作者自测。教程同时提醒:选择题高分不等于临床有用,真实场景没有选项;过了考题筛还要做开放式评测和随机对照。成本例子按 2025 年 12 月 Gemini 3.0 报价:输入 2 美元/百万 token(prompt 短于 200k),输出 12 美元/百万 token;一千份 MIMIC-III 出院小结大约四百万 token,提示侧大约 8 美元。7–8B 模型往往一张 A100 40GB 就够,70B 通常要多卡。

为什么重要

给不会自己搭评测的医生和研究员一条能照着做的路径。五类任务分类能挡住「什么都丢给聊天框」;HIPAA 和本地部署写进选模型步骤,比事后补合规更早。配套代码把 tokenization、温度、CoT、few-shot、RAG、微调数据准备做成可运行笔记本。

它仍然是入门手册。结构化抽取这类简单任务,教程承认微调过的 BERT 经常不输 LLM。已经有成熟评测栈的团队,这里的增量主要是把步骤写全,并把 2025–2026 的模型名单更新进来。

局限与存疑

Nature 正刊走订阅。解读依据是作者公开的 arXiv 稿和配套代码,摘要、四张图题、MedQA 表与正刊页面一致,但排版和个别段落可能与付费版有出入。

MedQA 表是拼盘,来源从系统卡到第三方榜单都有,横向比要小心设置差异。十项最佳实践里「默认 CoT」「温度 0」是经验规则,本教程没有在同一批医学数据上做消融。

「大约 100 条测试样本」沿用既有评测规模,对高风险临床决策偏少。偏见监测指向外部基准,没有给出本工作流上的实测差距。模型名单会过时;生命周期管理只点到了提示要重做、性能要重验。

术语

原文与代码

社区讨论

全部论文解读