OCT-Bench 用 10,076 题测试多模态模型能否读懂视网膜扫描
Baochen Fu · hf · 2026-07-21
OCT-Bench 用 10,076 道题系统评测多模态模型看懂 OCT
这篇工作提出了一个面向光学相干断层扫描(OCT)的新基准 OCT-Bench,目标不是只测模型能否粗分疾病,而是看它是否真的理解眼科影像并完成临床推理。
- 数据规模:基准包含 10,076 道选择题,由 4,137 张 OCT 图像构建,覆盖 7 个公开数据集。
- 任务设计:按真实临床解读流程,建立了 20 个细粒度任务,分为 感知、认知、推理 三层。
- 覆盖内容:影像属性、视网膜解剖、病灶特征、空间关系、疾病判断、治疗决策、预后管理等。
- 评测对象:测试了 20 个代表性 MLLM,包括闭源模型、开源通用模型和医学专用模型。
- 主要结论:当前模型距离可靠的 OCT 理解仍有明显差距;医学微调和更大规模并不能在各能力层级上稳定带来提升。
作者希望借助这个基准,更细致地定位多模态模型在医疗影像理解中的瓶颈。
「多模态」频道最新
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11