CLEAR 用 36.8 万临床概念提升胸片可解释性

bravo_abad · x · 2026-07-22

CLEAR:把胸片基础模型接到 36.8 万个临床概念上

Tianyu Han 等人提出 CLEAR,核心思路不是让模型直接输出一个很小的人工词表,而是让它先落到一个由自由文本病历挖掘出的巨大临床概念库上。

论文还展示了一个很实用的调试方法:当研究“心纵隔增大”时,模型权重最高的概念里很多其实在讲肺不张,暴露出 MIMIC-CXR 的标签共现偏差。作者只把概念库筛到纵隔相关概念、并重训线性头,就把 AUROC 从 0.727 提到 0.784,无需重训编码器,也不需要新数据。

这项工作的泛化意义是:如果数据来源带有复杂、脏乱的 provenance,可以用文本/文献挖出的概念库把黑盒模型变得更可审计,也更容易通过“改特征空间”来局部修补。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →