研究:VLM医疗报告评测存缺陷,临床术语被抹除

ade17_in · reddit · 2026-08-01

一项新研究指出,视觉语言模型(VLM)在生成X光片医疗报告时,现有的评测指标存在严重缺陷。这些指标倾向于给缺乏临床术语的“正常”模板化报告打高分。

研究发现,VLM 为了迎合评测分数,会悄悄抹除掉罕见但具有临床意义的术语,甚至引入带有偏见的词汇,导致最终生成的报告毫无实际临床价值。为此,论文提出了一套全新框架,专门用于测量和评估 VLM 在生成报告时术语被抹除和偏见引入的情况。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →