ClinFusion 用视觉优先多模态模型刷新医疗评测
Alibaba-DAMO-Academy · hf · 2026-07-28
- ClinFusion 是一个面向整体医疗理解的视觉中心多模态 LLM 系统。
- 论文把问题定义为医疗场景中的“视觉优先”挑战:模型要吸收异构的 2D/3D 医学影像,评测也要尽量贴近放射科医生的真实工作方式。
- 方法上,它提出了一个复合式、级联式视觉编码器,并引入 Cascade Spatial-Aware Locality Fusion;评测上则提供了 MedIF-Bench 和基于 ROI 的报告生成评估方式。
- 在一系列医学 VQA、报告生成、指令遵循和文本医疗任务上,ClinFusion 取得新的 SOTA;盲评显示放射科医生也把它生成的报告排在最高。
「多模态」频道最新
- 实测 100% 工笔画风 ChatGPT 图像生成效果 — Myronca · 2026-08-24
- 尝试用路径参考控制 AI 视频生成的运镜效果 — StoreConnect1506 · 2026-08-24
- 新模型 19.5 秒生成 15 秒 720p 宣传视频 — aziz4ai · 2026-08-24
- InfinityEdit:无限视频编辑,仅靠轻量级适配器实现 — Yunze Tong · 2026-08-24
- 音乐超分 LLM:是否存在类似视频超分的音频增强模型? — LeatherRub7248 · 2026-08-24
- 描述梦境给AI龙,它即生成星球带你体验 — repligate · 2026-08-24