ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang, Jinwang Wang, Pengju Wang, Zhitao Zeng, Yizeng Han, Yan Xing, Shengxuan Luo, Tao Feng, Qing Xie, Weigen Yao, Yi Yang, Zuozhu Liu, Jiasheng Tang, Shaocheng Wang, Jitao Wang, Jiahong Dong, Weihua Chen, Feng Xu, Fan Wang
cs.CV, cs.AI, cs.CL
2026-07-28
ClinFusion 用级联视觉编码器(CaSL Fusion)统一 2D 和原生 3D 医学影像,配套 RoI-grounded 评测;24 项医疗 benchmark 拿 20 项最优,16 项多模态里 13 项超 GPT-5.2/Gemini-3-Flash。
把多模态大模型搬进临床,作者把核心难点定位成「视觉为中心」:模型得吃下异质的 2D(X 光、病理、眼底)和 3D(CT、MRI)影像,评测还得对齐放射科医生的真实工作流。现有医疗 MLLM 两条路都有病,要么把 3D 切成 2D 片牺牲结构信息,要么 3D 路线需要繁琐的对齐流程;评测上又只用 BLEU/ROUGE 这类字面匹配或粗粒度 LLM 打分,既不细也不查事实性。
ClinFusion 基于 Qwen-VL,核心是组合式级联视觉编码器加 Cascade Spatial-Aware Locality(CaSL)Fusion 算子。
编码器是一组:基础 Qwen ViT,加 ConvNeXt(局部高频纹理)、DINOv2(自监督语义)两个 2D 专家,再加一个用对比学习在医学体数据上预对齐过的原生 3D 编码器。CaSL Fusion 用局部交叉注意力逐级把这些特征融进 Qwen ViT 表示:对每个 token,只从对方特征图上取 k×k 邻域做 attention,残差接回去;多个编码器级联,左结合,基础表示始终做 query。训练时还做随机残差正则(Bernoulli drop 0.1)。3D 体数据走双路,原生 3D 编码加取 4 张代表切片做 2D 锚,再用深度感知的 3D CaSL 让锚特征跨深度 attend 体素上下文。
评测框架也重做。MedIF-Bench(900 样本、7 类任务)测指令遵循,用正则查格式合规而非医学正确性。报告生成用 RoI-grounded 三段式:先从标准报告抠临床指征和关注区域(严格防泄漏),再带上下文生成,最后用 LLM-as-judge 把诊断主张拆成匹配/漏掉/幻觉三档算 Precision/Recall/F1,比 RadGraph-F1 更耐同义改写、不吃长度亏。
训练分四阶段渐进:通用视觉语言对齐、医学知识注入、指令微调、3D 体数据适配。
医疗 MLLM 里 24 项 benchmark 拿下 20 项最优;对比闭源 GPT-5.2、Gemini-3-Flash 在 16 项多模态里 13 项更好。
| benchmark | ClinFusion | 对比 |
| AMOS-MCQ(3D VQA) | 8B 80.2 | Hulu-Med-32B 73.9;Gemini-3-Flash 低 16 分 |
| CT-Rate Report F1 | 32B 23.9 | Gemini-3-Flash 20.2;GPT-5.2 14.1 |
| MedIF-Bench 指令遵循 | 8B 98.1 / 32B 98.9 | GPT-5.2 96.0;Gemini-3-Flash 96.6 |
| CheXpert-Plus Report F1 | 37.8 | Hulu-Med-7B 31.9 |
六位执证放射科医生(6 年以上)盲评 300 例:带 agentic 工具的 ClinFusion 在准确率、完整度、可用性每个维度都第一,对 Hulu-Med 和 Gemini-3-Flash 显著(p<0.001)。RoI 指标在 11 个自动指标里和专家判断相关性最高(Kendall τ=0.511)。
医疗影像是 MLLM 少数有真实落地价值的垂直领域,但 3D 影像(CT/MRI)长期是开源模型的弱项。ClinFusion 把 2D 和原生 3D 统一进一个编码器、又把评测对齐到放射科医生的真实判断,两个工程难题一起推。对做医疗 AI 的团队,模型和评测协议都开源,可作底座和基准。它也示范了「评测要贴着临床工作流设计」这件事本身的价值。
agentic 工具集还小,作者说要扩到超声、MRI 和治疗规划。知识密集的纯文本 benchmark 上和闭源模型仍有差距(归因于容量和训练数据规模)。论文自己也强调,真正临床转化需要严格的人在环诊断准确性、患者预后评估和伦理监管,目前只是技术层面的领先。模型规模(8B/32B)和具体训练数据量没有完全披露。