Towards Expert-level Medical AI for Real-time Video Consultations
Mahvish Nagda, Jihyeon Lee, Matthew Thompson, Chunjong Park, Tim Strother, Valentin Liévin, Roma Ruparel, Akshay Goel, Teya Bergamaschi, Suhana Bedi, Meet Shah, Pavel Dubov, Liviu Panait, Toshiyuki Fukuzawa, Sam Schmidgall, Craig Schiff, Joseph Xu, Aliya Rysbek, Yana Lunts, Jan Freyberg, Rebecca Hemengway, Sunny Virmani, David Racz, Carey Radebaugh, Joëlle Barral, Kavi Goel, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Gregory Wayne, Tao Tu, Yun Liu, Ethan Goh, Christina Chen, Ryutaro Tanno, Po-Hsuan Cameron Chen, Mike Schaekermann, Anil Palepu
cs.AI, cs.CL, cs.CV
2026-08-11
谷歌用 Gemini 三智能体异步架构做实时视频问诊,百例 OSCE 诊断准确率 91%,超过初级保健医生的 77%,目前只在职业模拟病人上验证、尚未可部署。
真实门诊从来不只是文字。医生一边问话,一边在打量病人的脸色、呼吸、姿态,捕捉说话里藏着的喘息或颤抖。纯文本的医疗 AI 把这一整层感知维度丢掉了,对说不清症状的老人和孩子尤其吃亏。
谷歌在 2024 年用 Shah 等人的工作证明了「能听能看」的医疗 AI 在 20 个场景里跑得通,但没到医生水平。难点是一个结构性矛盾:实时视频问诊同时要三样互相打架的东西,近乎即时的对话响应、扎实的临床推理、对音视频流的实时感知。把推理做深,延迟就高,对话就卡;把延迟压低,推理就只能浅尝。
AMIE(Video)用 Gemini 3 Flash 和 Gemini 3.1 Pro 搭了一个三智能体异步架构,核心思路是把「快」和「慢」拆开:
三个智能体异步协作:Talker 负责流畅的快速响应,Planner 和 Perception 在后台慢慢算,算完把结论喂回给 Talker。这一步把平均轮次延迟从顺序架构的 21.4 秒压到 2.6 秒,接近自然对话节奏。团队还专门建了一套临床音视频线索的分类法和自动化评测,用来在开发阶段持续给系统打分。
在一项随机 OSCE(Objective Structured Clinical Examination,客观结构化临床考试)研究里,100 个临床场景、15 名职业模拟病人、10 名美国执业初级保健医生(PCP)、20 名评审医生参与。对照组的真人医生被要求关掉摄像头,以排除「看得见脸」带来的偏差。诊断准确率上,AMIE(Video)首选项命中参考诊断的概率是 91%,真人医生是 77%(p=0.039);放宽到前三项,差距收窄到 98% 对 90%(不显著)。
在六维病例评分上,AMIE 全面不输或领先:
| 维度 | AMIE(Video) | 真人医生 | p 值 |
| 总分 | 83% | 68% | 1.3×10⁻⁹ |
| 临床推理 | 90% | 76% | 2.0×10⁻⁵ |
| 感知与检查 | 74% | 47% | 1.7×10⁻⁹ |
| 沟通 | 85% | 68% | 6.6×10⁻⁷ |
| 问诊 | 86% | 78% | 1.2×10⁻³ |
| 处置方案 | 79% | 67% | 8.9×10⁻⁵ |
视频的真正价值体现在感知与检查:AMIE 利用实时视频辅助信息收集得分 77% 对 51%,引导病人做体查 72% 对 39%。平均问诊时长 8.94 分钟,和真人医生的 9.30 分钟相当。
病人偏好是另一幅图景。模拟病人更认可 AMIE 在「评估病情」和「解释病情」上的表现(均 p=0.04);在「建立关系」和「建立伙伴感」上倾向真人医生,尽管差异不显著。评审医生给 AMIE 的共情(82% 对 71%)和建立关系(80% 对 69%)评分反而更高。也就是说,同行看录像觉得 AMIE 更体贴,病人自己却觉得真人更亲切。
模态对比里,视频界面全面胜过纯文本:沟通有效性 89% 对 79%,便利度 88% 对 71%,被理解感 90% 对 81%。
这是「能看能听」的医疗 AI 第一次在结构化考试里摸到、甚至超过执业医生水平。对从业者来说,信号有三层。多智能体解耦这个架构思路被验证有效:把延迟敏感的对话和算力敏感的推理拆开异步跑,在医疗这种「既不能慢又不能浅」的场景里是一份可行配方。音视频感知确实带来了文本拿不到的诊断增益,尤其在需要观察身体的检查环节。三是它划清了边界:这是一台考试机器,不是一台可以上线的问诊机器。
作者自己列了一长串,这里挑要紧的。系统是离散轮次对话,做不到人类那种话头交叠和即时插话。高频或细微的动作它看不准:眼球震颤(nystagmus)只有 3%,静止或动作性震颤 24%,情绪与表情 29%。有时它看到了线索却没转化成临床动作,比如察觉到音质差,却不提醒对方调一下。
研究本身的生态效度也要打折。场景只挑了「能演」的病,演不了的皮肤科直接排除;用的是职业模拟病人而非真实病人,老年病例还因为招不到合适的年长演员而受限。盲法不完美:Talker 的合成嗓音一听就不是真人,病人知道自己面对 AI 时表现会变,真人医生还被要求关了摄像头。
更根本的一点:OSCE 是结构化考试,衡量的是单次表现,不能等同于真实诊室里长期随访、共担决策的临床能力。作者明确说,这套系统尚未准备好用于真实临床,需要大量真实工作流的验证。本研究由 Alphabet 资助,作者多为谷歌员工并持股。