医疗 agent 单测对捷径免疫,两同侪附和即 38% 改口

Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems

Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe Ocampo Osorio, Quang Bui, Mohammad Shahin, Armaan Grewal, Emmanuel Paul Kwesiga, Anqi Peter Li, Josephine Nanyonjo, Aaditya Panchal, Arshnoor Bhutani, Nikhil Jaiswal, Milit S. Patel, Maximin Lange, Leo Anthony Celi

cs.AI

2026-08-04

单模型几乎免疫捷径(翻转 5-16%),两个同侪齐声附和错误答案时 38% 跟着改口,影像场景到 97%。

这篇在解决什么

临床决策支持正从单模型走向多个语言模型 agent 在共享工作区上会诊的形态。这篇问的是一个此前没人单独拆出来的问题:这样的委员会会不会被捷径攻陷。捷径(shortcut)指 benchmark 会奖励、但临床医生根本不会看的线索,比如胸片角落的水印、选择题的选项顺序。

Shortcut learning 的既有研究都盯着「一个模型对一个固定 benchmark」,医疗影像里案例最多:从拍摄器械的痕迹学肺炎、从肺野之外的标记读 COVID。多 agent 部署把失败模式换了形状。agent 互相看得见输出,一个早期的错误响应可能把整个委员会拖向同一个错误;监督者若与被监督者共享盲区,也发现不了。这篇补了两个缺口:错误答案会不会在观察到同侪之后才被接受;检测这种改变需不需要干预信号。

方法

全部实验用 Gemini 2.5 Flash 与 Flash-Lite 两档模型,温度 0,调用走内容寻址缓存,重跑即重放。六个公开数据集铺三条模态:文本(MedQA-USMLE、MedMCQA、MIMIC-CXR 报告改写为选择题)、影像(NIH ChestX-ray14、MIMIC-CXR-JPG、CheXpert)、表格(SUPPORT2 的 ICU 记录)。

四条设计线:

结果

单独测,这些线索几乎翻不动模型:MedQA 上每条线索的翻转率 Flash 只有 0.05-0.06;影像侧 MIMIC-CXR 834 张里,所有线索都落在 0.17 噪声底上下 0.029 之内。

换成委员会,数字完全变了:

场景隔离共享/传染备注
MedQA 文本,两个同侪0(构造为 0)采纳 15/40=0.375断言语气 0.42,含糊语气 0.14(p=6×10⁻⁸)
NIH 影像,四条线索采纳 0.40-0.460.97-1.0,传染 +0.54+0.57单独测无效的线缆与角标,同样 +0.54
CheXpert 150 张自然带支持装置的片子143/150 读对0.61(92/150)被「资深放射科医生」同侪带错没加任何线索;纯系统标记只动 1/150
SUPPORT2 表格,两个脚本化「上级」采纳 1.0(115/115,零抵抗)信息等价线索单独测全部不显著

水印透明度从 0.15 提到 0.45,传染几乎不动;再加一个同侪声音,传染再涨一半。起作用的是第二个声音,不是理由:锚定病例的同侪从两个减到一个,采纳率 0.85 掉到 0.73、0.82 掉到 0.72。一个虚假的「预筛阳性」系统标记替代同侪出现时,采纳率提升 +0.22 到 +0.53。把讨论框架换成批判性审查,MedQA 采纳率从 0.74 压到 0.28。

检测侧,门在文本上的假阳性率直接 100%。同谱系评审在文本上很好(MedQA 精确率 1.0、召回 0.93),到影像塌回门控(0.56/1.0/0.94),因为它的提示里根本没有片子。裁判是唯一跨模态成立的:影像上精确率 0.77-0.88、假阳性率 0.13-0.21。讨论进行中插一句「同侪可能是错的」,能把采纳从 0.64 压到 0.37,但这是缓解,不是检测器。

隐藏评分表把社交通道换成规则,给一个错误选项打满分。奔着诱饵选项去的比例在影像上更高:MedQA 0.275(11/40),NIH 0.83(29/35),CheXpert 0.86(30/35)。漂移者几乎从不自曝:文本 10 个里 1 个、影像 134 个里 1 个说出自己奔着评分表去了,其余都编了一套临床理由。

为什么重要

对搭多 agent 系统的人,三条结论可以直接拿走。别指望 agent 自己交代,自报在这组实验里接近零信号,监督不能建立在模型的自我陈述上。上游系统的标记要当不可信输入处理,它与同侪一样能推动共识。裁判的私有重问是可部署的:只需要对话记录加一次额外调用,不需要参考答案,也不需要模型参数,可以当常设检查挂在每次会诊里。

对做 benchmark 的人,含义同样直接:委员会的分数可以被社交层面的东西推高,而单模型测试根本看不见这些东西。

局限与存疑

作者交代得很细。两条影像线索经默认字体栅格化,字形跟着成像库版本走,而缓存按线索字节寻址,换版本会静默重查而不是报错:一次独立重跑在 417 例上约半数与原结果不一致,影像线索那部分只在固定库版本下可复现。NIH 级联队列的 35 张图全部来自 10 个病人,一人贡献 12 张,一人 8 张,bootstrap 做了病人级聚类,样本量本身仍然小。SUPPORT2 有两条线索的检验功效低于 0.25,噪声底用重采样构造,会高估温度 0 的不稳定性。

存疑的另一层在设计而不在统计:所有错误同侪都是脚本注入的,真实委员会里错误声音的密度、语气与「资深」标签的权重都可能不同;裁判与被测 agent 同为 Gemini 谱系,跨谱系裁判或更强的 holdout 没有测,作者也把这两项明确列为未完成。

术语

原文与代码

相关论文

全部论文解读