7 个开源 VLM 本地比拼:谁最会给医学图像做脱敏
MaziyarPanahi · x · 2026-07-22
我们把 7 个小型开源视觉语言模型当作本地“二次阅片”来做医学影像脱敏评估。
- Qwen3-VL 4B:7/7 个标识识别成功,耗时 6.9 秒,0 误报,最终被选中。
- Gemma 4 E2B:6/7。
- Qwen3-VL 2B:4/7,但速度最快。
- NVIDIA LocateAnything-3B:框得很准,但完全不会判断什么是“个人信息”。
- InternVL3 2B:把患者姓名读对了,却仍然判定“不是个人信息”。
作者强调的结论是:“读出来”很容易,真正难的是“判断”。后续例子里,OpenMed 的 PII 模型放过了一张胸片,但 Qwen3-VL 又重新检查出图像里还残留着诊所名称。相关模型都在 Hugging Face 上开源。最后抛出的问题是:每张扫描图像是否都该配一个第二阅片人?
所属事件:实测七款开源VLM医学影像脱敏 Qwen3-VL胜出(3 条相关)→
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11