胸片报告生成模型 BERTScore 0.78,却悄悄抹掉 32~35 个临床术语

Measuring What VLMs Don't Say: Validation Metrics Hide Clinical Terminology Erasure in Radiology Report Generation

Aditya Parikh, Aasa Feragen, Sneha Das, Stella Frank

cs.CL, cs.AI

2026-03-02

胸片报告模型靠「模板塌缩」把 BERTScore 刷到 0.78,却抹掉带性别属性的临床术语;DTU 提出 CAD、WAE 两指标,量化评测看不见的失真,随机解码只会把它换成新偏置。

这篇在解决什么

让视觉语言模型(VLM)自动读胸片、写放射报告,是医疗 AI 落地的热门方向。业界评估这类报告几乎只看词重叠分数:BLEU、ROUGE、BERTScore,生成文本和医生写的参考报告重叠越多,分数越高。

这套打分方式有个老问题叫「模板塌缩」。模型反复吐「未见明显异常」这类万能正常模板,因为正常胸片在数据集里占多数,这种偷懒输出反而能刷出漂亮分数。丹麦科技大学(DTU)这篇要捅破的,是这个问题更隐蔽的一面:被抹掉的不只是个体化细节,还有和患者性别强绑定的临床术语,而现有指标连它发生都看不见。这是一篇测量学和公平性论文,不是新模型。

方法

作者先定义什么叫「一个词和某个性别绑定」。对每个临床词 w,统计它在女、男患者报告里出现的频率,算一个狄利克雷平滑后的对数概率比 s(w)=log[pF(w)/pM(w)],再转成 z 分数。比如 mastectomy(乳房切除)在参考报告里和女性强相关,AICD(植入式除颤器)和男性强相关。

CAD(Clinical Association Displacement,临床关联位移) 逐词追踪这些绑定在模型输出里变成了什么样,分三类:抹除(参考里强相关,生成里变中性)、新偏置(原本中性,生成里冒出新的性别绑定)、偏置翻转(绑定的性别整个反过来)。阈值取 zneutral=1、zstrong=2。

WAE(Weighted Association Erasure,加权关联抹除) 把所有词的位移加权求和,汇总成一个全局「临床信号损失」分数,还能按性别拆出 WAEg 和差异量 ΔWAE。显著性用标签置换检验确认不是随机抖动。

为什么要另起炉灶:既有的公平性指标多看组分 F1 差距,看不到词汇层面的归属迁移;WEAT 作用在静态词向量上,对「换一种解码方式就变样」这种动态变化完全失明。CAD、WAE 直接作用在模型实际吐出的词表上。

作者还把解码策略当成一个混淆变量来扫:贪心、束搜两类确定性,加保守采样、富采样、top-k、核采样四类随机,一共六种。

结果

ReX-QWEN(Qwen3-VL-8B 用 LoRA 在 6 万张胸片上微调)在标准指标上打得过一众基线,但模板多样性只有 14.1%52.7%。把六种解码摊开看,确定性策略词表塌到只剩 2238 个独有词,约是参考词表的 5%;贪心和束搜生成的报告里只有 0.3%0.5% 不重复。

解码BERTScore F1抹除词数模板多样性WAE(pred)
贪心 / 束搜0.7832350.3%0.5%2.50
富采样(T=0.7)略低减少,但新增 2565 个偏置词36.3%100%33.81

贪心解码下 BERTScore F1 照样有 0.78,CAD 却揭出 3235 个词被系统性抹除,几乎覆盖参考报告里所有强性别绑定词。mastectomy、AICD 的预测性别归属都滑向中性。

随机采样把词表找回来了,代价是新偏置:pneumothorax(气胸)在参考报告里其实是中性的(zref=0.15),低温生成却硬给它造出一个强男性绑定(zpred=−5.69)。整个 WEAT 效应量始终接近 0,说明它根本看不见这些解码引起的偏移。

最能说明问题的是性别倾斜训练实验。把训练数据换成 67% 男性或 67% 女性,标准指标纹丝不动(BERTScore F1 仍在 0.760.78,RateScore 在 0.540.57,WEAT-ES≈0),ΔWAE 却从平衡基线的 −0.05 漂到男倾的 +0.79、女倾的 −0.94。换 LLaVA-Rad 在 ReXGradient 和 CheXpert 上复现,模式一致:确定性策略模板多样性 45.7%、抹除 19 词、偏置翻转 5 个;富采样多样性 91.1%、抹除降到 11、偏置翻转涨到 12。

消融把聚合阈值扫遍整个区间,六种策略的相对排序纹丝不动,说明这是生成的底层机制,不是阈值调出来的。

为什么重要

对要部署医疗 VLM 的人,结论很直接:别拿 BERTScore、ROUGE 单独挑模型和解码策略。一个 0.78 的模型可以一边拿高分,一边把某一类患者的关键发现悄悄吞掉,而你的榜单上什么异常都不会显示。补 CAD、WAE 加几个多样性指标成本很低,换来的是把一个当前评测完全看不见的失效模式暴露出来。

解码策略是个公平性开关,不只是质量开关,这一点对放射报告之外也成立。任何奖励「安全通用」输出的生成评测,都可能被同一套机制骗到。

诚实地讲,这是一篇诊断和评测论文,不是新模型。它不会给你更好的报告,它告诉你现在量的那个「好」是错的。

局限与存疑

作者自己承认:只分析了二元性别,年龄、族裔、交叉分组留待后续;CAD 标出的抹除是否真对应「临床上有意义的遗漏」还需要医生复核;实验只覆盖胸片。

另有几处存疑:阈值 zneutral=1、zstrong=2 是合理的默认,但消融只扫了聚合阈值 pdisp,没扫这两个分词级阈值本身。新偏置到底是「找回的真实信号」还是「噪声」,作者自己也抛出了这个问题却没真正回答;WAE 能标出位移,分不清真信号和幻觉。N=2000 的评测子集做词汇级关联统计,对罕见词偏吃力。GPT-4.1 zero-shot 当基线,和微调过的医疗模型比略有不公平。

术语

原文与代码

社区讨论

相关论文

全部论文解读