Google 用模拟门诊做强化学习训练医学 agent:诊断准确率提 7 点、漏红旗体征降 31%

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang

cs.AI, cs.CL

2026-08-08

Google DeepMind/Research 用 GRPO 在模拟多轮门诊里训练 Gemini 临床 agent:对抗场景诊断准确率从 81% 升到 88%、漏红旗体征降 31%,盲评专家 87.6% 更偏好它,能力迁移到 AMIE/AgentClinic/CRAFT-MD。

这篇在解决什么

诊所里真正的诊疗不是答一道多选题。医生要在和病人的多轮对话里把病史问出来、修正自己的假设、再做出决定。大模型在静态医学考试(如 MedQA)上分数已经很高,可把「一整个就诊流程」作为优化目标的研究几乎没有。临床诊断里最常见的一种错误叫「过早收敛」:问了两三个问题就急着下结论,关键信息还没问全。ResidencyRL(来自 Google DeepMind 与 Google Research)想做的,就是把这个完整的临床决策序列变成可以训练的东西。

方法

核心是搭一个能反复演练的模拟病房,再让策略模型在里面用强化学习试错。

模拟环境分几块。场景生成流水线先按美国人口分布采样人口学特征,用 Gemini 3.1 Pro 生成临床病例(主诉、病史、ground-truth 诊断),再做质量校验和 TF-IDF 去重。病人由 Gemini 3.5 Flash 扮演,根据病例作答,并带健康素养调节和信息不对称(病人不会一开始就把关键信息全倒出来);另有一套对抗性「扩展包」,专门造安全挑战场景。策略模型(同样用 Gemini 3.5 Flash 初始化)每条轨迹最多走 60 轮对话加 8 次工具调用,工具是七种病历书写 instrument:主诊断、鉴别诊断、紧急度分级、处置方案、面向病人的总结、SOAP 笔记等。

奖励是这篇的硬功夫。主奖励 Rprimary 取值 0 到 3,按六个维度共 26 个 Likert 子轴打分:诊断(权重 2/9)、处置(3/9,含紧急度、检查、治疗、随访、整体质量、安全)、沟通(1/9,用 PCCBP 量表)、病历书写(1/9,用 PDQI-9 九轴)、病史采集(1/9)、风格(1/9,例如是否一次只问一个问题)。惩罚项 Rpenalty 管红线:幻觉、禁忌操作、漏掉红旗体征,外加解析错误和轮数过多。优化用 Group Relative Policy Optimization(GRPO),每个场景跑 K 条并行轨迹估优势函数。训练混合 49,870 个远程问诊场景、5,000 个病史采集场景和 2,583 个对抗场景。

有两个关键设计选择。奖励直接对齐临床教育里真实在用的评分量表(PDQI-9、PCCBP),不另造指标;对抗病人模拟器专门逼模型把该问的问完,对症下药地治「过早收敛」。

结果

对抗场景最能说明问题(n=200):

指标基线ResidencyRL
诊断准确率(rubric ≥4/5)81.0%88.0%
漏红旗体征率45.5%31.5%
漏关键问题率65.5%43.5%

普通远程问诊场景上,处置质量从 3.98 升到 4.52(1-5 量表),紧急度判断 93.5% 到 98.5%,社会与生活方式病史采集从 1.31 升到 2.64。

能力能迁移到没见过的基准。在 AMIE Mx 多次就诊基准(120 个场景、360 次就诊)上,处置推理(MXEKF)从 80.1% 升到 88.4%,病人沟通(GMPCQ)83.7% 到 92.2%,临床技能(PACES)79.6% 到 84.8%。外部基准 AgentClinic-MedQA(+4.2 个百分点)、AgentClinic-MIMIC-IV(+6.5)、CRAFT-MD(+3.2 到 +4.7)也全部方向性提升。

97 位盲评临床医生做并排对比,87.6% 的情况下更偏好训练后的 agent(信息采集完整度 90.7%,处置方案恰当性 75.3%)。

为什么重要

这篇给了一条可复制的路径:把一个会答医学多选题的 LLM,变成能跑完整多轮门诊流程的 agent。贡献不在某个 SOTA 数字,而在那套对齐真实临床量表的奖励设计加上对抗模拟器。它说明「完整的临床决策序列」是可以被强化学习学到的,而且学到的能力能迁移。对做医疗 AI 的团队,这套 reward 加 simulator 配方是直接能借鉴的工程蓝图;对更广的 agent 研究,它也是一个「长程多轮、带工具调用、结构化奖励」能训出来的证据。

冷水也要泼:这都只是模拟环境里的结果。作者自己反复强调,真要在真实病人身上用,还需要前瞻性真实工作流验证。

局限与存疑

作者承认:模拟器不建模治疗的下游生理效应(开出的药后续会怎样没人模拟);真实世界前瞻验证还没做;对抗场景上红旗体征仍有 31.5% 漏诊、关键问题仍有 43.5% 漏问,离可部署还很远。读下来还有两点存疑。奖励主要靠 LLM 当 judge 在 26 个子轴上自动打分,这种自动评分的偏差会不会被强化学习放大,论文讨论得不够;此外训练和评测用的场景与病人都来自 Gemini 家模型自己生成,是否存在分布闭环、对外部真实病例的泛化够不够,也需要更多独立数据来验证。

术语

原文与代码

社区讨论

相关论文

全部论文解读