A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic
Peter Brodeur, Jacob M. Koshy, Anil Palepu, Khaled Saab, Ava Homiar, Roma Ruparel, Charles Wu, Ryutaro Tanno, Joseph Xu, Amy Wang, David Stutz, Wei-Hung Weng, Hannah M. Ferrera, David Barrett, Lindsey Crowley, Jihyeon Lee, Spencer E. Rittner, Ellery Wulczyn, Selena K. Zhang, Elahe Vedadi, Christine G. Kohn, Kavita Kulkarni, Vinay Kadiyala, Sara Mahdavi, Wendy Du, Jessica M. Williams, David Feinbloom, Renee Wong, Tao Tu, Petar Sirkovic, Alessio Orlandi, Christopher Semturs, Yun Liu, Juraj Gottweis, Dale R. Webster, Joëlle Barral, Katherine Chou, Pushmeet Kohli, Avinatan Hassidim, Yossi Matias, James Manyika, Rob Fields, Jonathan X. Li, Marc L. Cohen, Vivek Natarajan, Mike Schaekermann, Alan Karthikesalingam, Adam Rodman
cs.HC, cs.AI, cs.CL, cs.LG
2026-03-09
100名急症患者诊前与AMIE文字问诊,零安全叫停,前三名含对或很接近的诊断占75%,实用性与花费不如医生。
AMIE(Articulate Medical Intelligence Explorer,临床对话诊断系统)此前只在标准化病人中测过:诊断推理与全科医生大致持平,少数项目更好。真实患者的主诉会散,表达受焦虑、打字速度和健康素养影响。另外,模型的处理建议有可能造成伤害或延误,患者往往分辨不出好坏。
Google Research、Google DeepMind 与 BIDMC(Beth Israel Deaconess Medical Center)初级保健诊所做前瞻单臂试验:急症就诊前,患者用电脑与 AMIE 文字交谈,摘要交给接诊医生(PCP)。主问题是安全、对话质量和接受度;诊断和处理是否可靠,交给就诊 8 周后的病历。
底模是 Gemini 2.5 Pro,知识截止 2025 年 1 月,未做微调,开启 Thinking(先内部推理再作答)。沿用既有智能体,把提示词收到诊前问病史,并维护摘要、鉴别诊断(DDx)、信息缺口和处置草案(Mx)。问题随假设变化,不使用固定问卷。下结论前先复述,请患者改正。诊断与下一步都声明为供 PCP 讨论的可能。Mx 不向医患展示。50 例后因延迟改用 Gemini 2.5 Flash。
持证内科医生远程监看每一场,患者看不见监督者。四条叫停线覆盖自伤伤人、明显痛苦、临床伤害和患者要求停止。监看者结束后纠错。10 人试点后方案未改。
对象为旧患、满 18 岁、病历语言为英语、能用门户与电脑、单一主诉、已排除急诊。妊娠和精神主诉除外。报酬从 25 美元增至 50 美元,满 100 场完整对话停止。
8 周后,三名内科医生盲于 AMIE,凭病历确定最终诊断。另有两名医生用 Bond/Graber 五分量表评 DDx,5 分表示命中。八名医生再盲评双方 DDx 与 Mx,每例三人取中位数。名单截到等长,Mx 由 Gemini 2.5 Pro 改成统一格式,270 份经人工确认。PCP 就诊前已读摘要。
1452 次急症就诊中,口头同意 140 人,开聊 114 人,完成 100 人(87.7%)。设备或流程失败 7 人,系统不可用 5 人,中途因妊娠或精神问题退出 2 人。2 人未看门诊,分析 98 例。讨论估计纳入约占同期急症的一成。参与者偏年轻,51% 不满 50 岁,诊所同期 60 岁以上超过一半。预约主治 62 人、住院医 26 人、执业护士 12 人。
100 场没有安全叫停。监督者仅发言 3 次:澄清患者并没有的急症,交代急诊指征,改正把旧手术说成未来日期的错误。
以 8 周病历最终诊断为准。Bond/Graber 不低于 4 分(诊断在名单里,或非常接近)时,前 7 名覆盖 88/98(90%),前 3 名 73/98(75%)。排在第 1 名、且与最终诊断一致的是 55/98(56%)。有客观检查的 46 例仍高,推定诊断的 52 例倾向更高。PCP 没有对应的名次命中率。
盲评中 DDx 质量 p = 0.6,Mx 适当性 p = 0.1,安全性 p = 1.0。实用性 p = 0.003,花费 p = 0.004,均为 PCP 更好,用的是配对 Wilcoxon 和 Bonferroni 校正。评委认出来源的正确率 59.18%(95% CI 49.45% 至 68.91%)。
聊天后 GAAIS(对 AI 的态度量表)升高(p < 0.001),就诊后再无变化(p = 0.86)。PCP 问卷完成率 61.2%,60 份里 16 份未读摘要。读过的 44 人中,有帮助 75%,无害 68%,信任 64%,自认行为有变 57%,非常负面为 0。患者对保密和诚实的认可不到一半。
这次同时是前瞻设计、真实急症患者、医生现场监看,并且在结束时给出可能诊断。已有的真患者评估多是回顾病历,或限于热线、远程和专科采集。
模拟考试中 AMIE 占优,部分原因是医生也被限制在文字里。换成各自的日常方式后,DDx 与 Mx 的总体质量、适当性和安全性打平,实用与花费仍是医生高。十名高诊量 PCP 的访谈把它比作三年级医学生,患者进门时病史已经组织好。五名受访监督者把它放在住院医水平,并要求旁边有人。
适用面很窄:英语旧患、有电脑、无关妊娠精神、已经排除急诊。它减轻的是问诊前的整理。处置没有交给任何一方。
单臂试验看不出是否好过普通门诊。零叫停也建立在全程有人盯着、患者知情被观察之上。妊娠、精神主诉和需要急诊的情况被排除,期间没有转诊急诊,分诊安全没有被测到。
PCP 读过摘要,能查病历、能体检。AMIE 没有病历,也不能查体,DDx 更长。更长的名单和更宽的检查,被用来解释实用性和花费为何落后。52/98 的参照诊断只是推定。换用 Flash 之后的病例没有分开报告。约 7% 因设备失败,招募已经排除无电脑者,年龄结构也更轻。人类侧还包括住院医和执业护士。问卷缺失近四成。
还有一个校准问题。较准的 DDx 出现得很早,不确定度随轮次下降,对错两组的形状相近,打分者又是 Gemini 2.5 Pro。曲线变窄,没有标出错误。