2026-08-24
厦大与蚂蚁把Qwen2.5-7B做成中文互联网问诊风险守门员:先拆原子医学主张,不确定才检索。细粒度会话F1为0.7668,比Qwen3-235B-A22B高13.4个点;126名医生七维评分均超过4.2。
中国互联网问诊以文字为主,一轮对话可以从几小时拖到几天。医生在碎片化上下文里下诊断、开药,漏诊和错误前提不容易被当场拦住。现有医学 LLM 评测多半是静态问答或模拟问诊,安全判断靠提示词。直接拿来做实时风险告警会撞上三件事:对话太长,模型抓不住该核的句子;谄媚偏差把无害陈述标成风险,假阳性打乱门诊节奏;幻觉给出看似专业的药理机制,医生无法追证据。
厦大与蚂蚁把这个问题做成诊前守门员:只盯诊断、处方和医患对话里可核验的主张是否不完整、含糊、错误或误导,不试图替代医生做决定。
骨干是 Qwen2.5-7B-Instruct,整条 agent 流程用 GRPO 端到端强化学习。知识库合并丁香医生、腾讯医典、小荷、临床决策助手、百度健康和中国药典,16,535 条疾病、187,738 条药品,BM25 检索。
流程按主张而不是按整段对话走:
训练数据是瓶颈。从 Huatuo 百科问答抽 2,000 条,用 DeepSeek-R1-671B 做上下文扰动和标签反转,得到风险、无风险各半的任务样本。奖励分两路:JSON 格式对了才看结果;结果奖励为正确报风险 +1、正确报无风险 0、漏报或误报 −1。训练在最多 8 张 A100 80GB 上,论文写全程约 4 GPU-hours。
评测集 MedGuardEval 共 1,665 条对话、7,589 条人工原子主张,全是训练域外。REAL 235 条来自好大夫真实问诊,CASE 682 条由公开病例改写,DRUG 748 条由 NMPA 说明书生成。细粒度会话指标极严:所有主张都要拆对,风险状态都要对,会话才算对。
对照六套开源模型和三个基于同一 7B 骨干的 agent 框架(CoM、OctoTools、HealthCareAgent)。agent 基线整体细粒度 F1 只在 0.44–0.60。相对最强大模型基线 Qwen3-235B-A22B:
| 指标 | MedGuard | Qwen3-235B-A22B | 差值 |
| Precision | 0.6827 | 0.5535 | +0.1292 |
| Recall | 0.8746 | 0.7384 | +0.1362 |
| F1 | 0.7668 | 0.6327 | +0.1341 |
相对更大模型的平均提升,论文报的是精确率 24.8%、召回 17.6%、F1 22.1%。三个子集上召回维持在 86.1%–91.2%。按 ATC、语义、年龄、系统分层,平均 F1 0.77,Qwen2.5-72B 和 DeepSeek-R1-671B 都是 0.62;41 个子类里 38 个进前三、22 个第一。摘要里相对 SOTA agent 系统的平均优势是 21.20%–23.02%。
真实问诊里的风险分布也写了:抗寄生虫药和感觉器官用药风险发生率 83.33%、80.00%,血液类和杂类 42.31%、35.70%;新生儿 62.50%、婴儿 60.94%,高于成人 58.96%;有并发症 61.05%,无并发症 34.79%,癌症路径管理下 16.69%。
126 名执业医生和护士(10 个科室、至少 5 年经验)评了 604 条好大夫对话。七维李克特均分都超过 4.2(可用阈值预先定为 3)。已披露的六维:事实准确性 4.389、时间压缩 4.402、信息增益 4.295、沟通可用性 4.377、错误减少 4.284、法律伦理安全 4.332;高于 3 分的比例 83.60%–92.80%。同分数比 0.62–0.67,变异系数 0.22–0.24。
忠实性用 300 条主张做反事实扰动:无风险插入风险后 Risk Conviction Score 平均 +1.03,81.8% 上升;有风险修好后平均 −0.94,84.0% 下降。另 10,000 条未标注真实问诊上,MedGuard 报警 2,234 次,DeepSeek-R1-671B 报 4,785 次;平均实体密度 0.0105 对 0.0072。气道相关急诊识别率相对均值 +13.14%,多重用药 +0.1132。这批没有金标准,比的是报警量和密度,不是 F1。
7B 加检索和谨慎分层,在这项中文问诊核事实任务上压过 235B/671B 直出和通用 agent。对要上线的人,可复用的是「先拆自包含主张、不确定才检索、用格式加结果奖励做 GRPO」,不是再训一个 671B。知识库和三份带主张标注的评测集对复现有用。医生评分说明解释能看,假阳性没有把评分打到可用线以下。
它解决的是可核验主张,不是沟通技巧、情绪支持或伦理两难。10,000 条上 DeepSeek 报警量是它的两倍以上,说明大模型更爱报;MedGuard 用实体密度主张自己更准,但没有金标准就无法把密度直接读成精确率。
作者承认:只处理文本,没有影像和表格;定位是辅助,不替代医生最终判断;真实部署要前瞻性试验。更需要盯的是评测构造。进入 MedGuardEval 之前,DeepSeek-R1 或 Qwen3-235B 已经能做对的病例被丢掉,剩下的是大模型失手的难例,和这两套模型的差距会被放大。CASE、DRUG 由 LLM 改写或造对话,主张匹配也用 DeepSeek-R1,生成器和裁判有重叠。REAL 只有 235 条。医生评估看的是 MedGuard 报告的绝对李克特分,Table 8 没有并列其他系统。4 GPU-hours 的 GRPO 短得不寻常,论文没有给学习曲线或多次随机种子。知识库来源含商业百科,条目质量和更新频率未做独立审计。