OCT-Bench 用 10,076 题测试多模态模型能否读懂视网膜扫描
Baochen Fu · hf · 2026-07-21
OCT-Bench 用 10,076 道题系统评测多模态模型看懂 OCT
这篇工作提出了一个面向光学相干断层扫描(OCT)的新基准 OCT-Bench,目标不是只测模型能否粗分疾病,而是看它是否真的理解眼科影像并完成临床推理。
- 数据规模:基准包含 10,076 道选择题,由 4,137 张 OCT 图像构建,覆盖 7 个公开数据集。
- 任务设计:按真实临床解读流程,建立了 20 个细粒度任务,分为 感知、认知、推理 三层。
- 覆盖内容:影像属性、视网膜解剖、病灶特征、空间关系、疾病判断、治疗决策、预后管理等。
- 评测对象:测试了 20 个代表性 MLLM,包括闭源模型、开源通用模型和医学专用模型。
- 主要结论:当前模型距离可靠的 OCT 理解仍有明显差距;医学微调和更大规模并不能在各能力层级上稳定带来提升。
作者希望借助这个基准,更细致地定位多模态模型在医疗影像理解中的瓶颈。
「多模态」频道最新
- Fable 为 The Loom 一次做出音乐、乐器和视频 — Sauers_ · 2026-07-21
- 开源 TTS 清单按许可证优先筛选可商用模型 — mahimairaja · 2026-07-21
- AI 戏仿把 Chris Cornell《American Nightmare》做成了梗图海报 — 77sevens · 2026-07-21
- AI 游戏演示开始实时生成声音,配合世界模型画面 — mark_k · 2026-07-21
- Krea2 找到 Raw 4 步加 Turbo 4 步的图像工作流 — PropagandaOfTheDude · 2026-07-21
- Hugging Face 截图显示 Anima 扩散模型多个版本 — RafiHDW · 2026-07-21