7 个开源 VLM 本地比拼:谁最会给医学图像做脱敏
MaziyarPanahi · x · 2026-07-22
我们把 7 个小型开源视觉语言模型当作本地“二次阅片”来做医学影像脱敏评估。
- Qwen3-VL 4B:7/7 个标识识别成功,耗时 6.9 秒,0 误报,最终被选中。
- Gemma 4 E2B:6/7。
- Qwen3-VL 2B:4/7,但速度最快。
- NVIDIA LocateAnything-3B:框得很准,但完全不会判断什么是“个人信息”。
- InternVL3 2B:把患者姓名读对了,却仍然判定“不是个人信息”。
作者强调的结论是:“读出来”很容易,真正难的是“判断”。后续例子里,OpenMed 的 PII 模型放过了一张胸片,但 Qwen3-VL 又重新检查出图像里还残留着诊所名称。相关模型都在 Hugging Face 上开源。最后抛出的问题是:每张扫描图像是否都该配一个第二阅片人?
所属事件:实测七款开源VLM医学影像脱敏 Qwen3-VL胜出(3 条相关)→
「多模态」频道最新
- AI 生成的游戏世界可能只惊艳 30 秒,不够玩一小时 — Slight_Control9311 · 2026-07-22
- 用 Gemini 3.6 Flash 做出的浏览器黑洞 demo 只要三文件 — prasenx · 2026-07-22
- RunwayML Agent 生成了作品《The Bundyssey》 — tlakomy · 2026-07-22
- Storyboard Reference Studio 可把视频秒转分镜稿 — bennash · 2026-07-22
- 一段音乐提示词把东南亚民俗风揉进迷幻太空西部片 — bennash · 2026-07-22
- Rendergeist Pulse 做出 26 分钟音频响应视觉片 — bennash · 2026-07-22