牛津MedRSI按临床代价自造工具,青光眼平衡准确率达94.1%

MedRSI: Recursive Self-Improvement for Medical Agents via Clinically Aligned Self-Evolution

Junde Wu, Jiayuan Zhu, Minghao Hu, Fenglin Liu, Jiazhen Pan

cs.AI

2026-09-22

牛津与斯坦福提出MedRSI:医疗Agent按临床后果优先改失败,新工具须过三轮队列才入库。20轮后青光眼平衡准确率从56.2%升至94.1%,超过人工设计的MedAgent-Pro。

这篇在解决什么

现在的医疗Agent把通用推理模型和一批专家工具拼在一起:分割视杯视盘、算杯盘比、估射血分数。工具从哪来?临床医生先看出缺口,工程师再训练模型、写调用接口。部署之后Agent会撞上成千上万次失败,这些失败不会变成新能力。

Recursive self-improvement(RSI,递归自改进)把这个循环交给Agent自己:看失败、写新工具、留下有效的改动。直接搬到医学上有两个坑。失败频率不等于患者风险,漏诊晚期青光眼和把临界眼标成「可疑」不是一类错误。新工具如果当天就进正式工具箱,一次过拟合的发现会污染后续诊断轨迹,再催生更多坏工具。

方法

牛津与斯坦福的MedRSI把稳定Agent写成三件套:固定的多模态推理模型、固定的诊断流程、会增长的稳定工具注册表。每轮五步:诊断一批病人、按临床后果排序失败、把同类失败聚成缺失能力、用代码生成/工具组合/训练模型三条路造候选、在后续队列上试,过关才注册。推理骨干和流程规则全程不动,自改进只改工具表。

临床代价感知的失败优先:对每个错误,冻结的评判模型按任务量表打0到4分(可忽略到危急),优先级是「错了」乘以(1+λ×归一化代价),默认λ=2。晚期青光眼被当成正常并出院,会比临界误判分到更多改进预算。λ=0就退回按错误次数平均分配。

快发现、慢注册:发现集上只要终点变好就能进实验池;默认再过K=3个后续队列,平均性能提升超过δ(分类0.5个平衡准确率点),且临床代价不升,才写入稳定注册表。候选整包冻结并打版本哈希。规划器只在稳定工具集上收集新经验,实验工具只给对照副本用。

起点是OpenHands通用代码Agent,诊断用GPT-4o、温度0;反思和造工具温度0.7。公开任务20轮,每轮最多6个候选、共享12个A100小时。

结果

公开任务上,青光眼(REFUGE2)平衡准确率从56.2%升到94.1%,心脏病(MITEA)从56.5%升到82.3%。同期人工设计的MedAgent-Pro发表值为90.4%,复现为89.6%和77.1%。青光眼灵敏度从28.4%到92.0%,期望校准误差从0.29到0.05。五条独立轨迹终点落在93.4%–94.7%和81.2%–83.1%。

118个候选里41个进实验池,16个注册。杯盘分割Dice为0.87和0.95,垂直杯盘比与金标准相关r=0.91。左室分割Dice 0.90,射血分数平均绝对误差5.8个百分点。

接到未见过的私有任务上,从MedAgent-Pro出发:多模态青光眼平衡准确率从79.2%到92.1%,人工融合网络是87.8%;造影超声射血分数归一化误差从0.85到0.55,平均绝对误差5.1个百分点,人工回归器是0.66。Agent自己训练了把非造影映射到造影域的生成模型,再拿合成数据增强下游预测器。

配置20轮平衡准确率临床代价/100例30轮准确率
通用RSI77.4%9.272.7%
均匀优先88.7%6.088.3%
立即注册82.4%7.676.9%
MedRSI94.1%2.594.4%

均匀优先把63%的前十轮反思预算花在临界「可疑」眼上,训练准确率冲到97.8%,测试却卡在88.7%。立即注册曾在第8轮领先到89.6%,30轮掉到76.9%,攒了57个工具。一条纹理工具在发现集上+6.1点,三轮试验分别-2.3、-5.4、-3.1;完整流程在实验池就丢掉了它。

为什么重要

把RSI接到高风险领域,真正要改的是两处:改进目标按患者后果加权,永久能力按后续队列筛。只让Agent自己写工具不够。发现集上好看的改动,一旦进入稳定表,会改写以后所有诊断轨迹和以后所有发明方向。

代价也不便宜。公开任务一条轨迹约212加速器小时、19亿推理token、4.5天。四项任务合计651 GPU小时、32亿token、注册27个工具。代码已公开,私有队列不会公开。

局限与存疑

临床代价仍由同一家族的GPT-4o按冻结量表打分,和医生的加权κ只在校准集上报告。机制成立的前提是参考标签可靠、独立队列够用。私有数据来自两家三甲,没有前瞻性临床使用、工作流或患者结局。换Claude Sonnet 4.5、Gemini 2.5 Pro、Qwen2.5-VL-72B后,20轮青光眼准确率在89.8%–93.6%,11/16个工具功能四条骨干都找到了,但仍是同一套诊断终点。λ=8时改进过度集中在少数重症,准确率回落到92.4%。

术语

原文与代码

社区讨论

相关论文

全部论文解读