CLEAR 用 36.8 万临床概念提升胸片可解释性
bravo_abad · x · 2026-07-22
CLEAR:把胸片基础模型接到 36.8 万个临床概念上
Tianyu Han 等人提出 CLEAR,核心思路不是让模型直接输出一个很小的人工词表,而是让它先落到一个由自由文本病历挖掘出的巨大临床概念库上。
- 他们用 LLM 从 227,835 份报告中抽取出 368,294 个放射学观察概念。
- 训练时用 DINOv2 视觉编码器和文本编码器做 CLIP 式对比学习,数据是 0.87 million 组图文对、来自 239,391 名患者。
- 推理时,X 光图会先映射成对整个概念库的相似度向量,再投影到 LLM embedding 空间;零样本分类则在正负提示词上做 softmax。
- 在越南、西班牙和美国的外部数据集上,CLEAR 的零样本 AUROC 优于 CheXzero、BiomedCLIP 和 OpenAI CLIP。
- 线性探针平均成绩 87.0%,对比 BiomedCLIP 的 71.8%。
- 3 位盲评放射科医生认为其 top concepts 中 89.8% 具有诊断相关性,且没有发现数据集伪影。
论文还展示了一个很实用的调试方法:当研究“心纵隔增大”时,模型权重最高的概念里很多其实在讲肺不张,暴露出 MIMIC-CXR 的标签共现偏差。作者只把概念库筛到纵隔相关概念、并重训线性头,就把 AUROC 从 0.727 提到 0.784,无需重训编码器,也不需要新数据。
这项工作的泛化意义是:如果数据来源带有复杂、脏乱的 provenance,可以用文本/文献挖出的概念库把黑盒模型变得更可审计,也更容易通过“改特征空间”来局部修补。
「研究」频道最新
- 一篇把 AI Agent 拆成 20 个组件的实战清单 — goyalshaliniuk · 2026-07-22
- Nature 提示整段基因编辑可行,AI 可能帮助重建其原理 — nathanbenaich · 2026-07-22
- ForeAgent 先预测再执行,让智能体收敛快 6 倍 — jiqizhixin · 2026-07-22
- 播客梳理 Kimi、Qwen、GLM 与中文实验室开源竞赛 — natolambert · 2026-07-22
- GPT-5.6 一次答对单侧检验的 FDR-BH 新结果 — lihua_lei_stat · 2026-07-22
- Training an Agent 第 2 课补充蒸馏资料、幻灯片和录屏 — SergioPaniego · 2026-07-22