7 个本地开源 VLM 争夺第二读者,Qwen3-VL 4B 胜出
MaziyarPanahi · x · 2026-07-22
这条帖子做了一个很实用的本地评测:把 7 个小型开源 VLM 当作“第二读者”,看它们能否识别医疗影像里的身份信息。
- Qwen3-VL 4B:7/7 识别正确,耗时 6.9 秒,且没有误报,被作者选为“第二读者”。
- Gemma 4 E2B:6/7。
- Qwen3-VL 2B:速度最快,但只命中 4/7。
- NVIDIA LocateAnything-3B:框得很准,但不会判断哪些内容属于个人信息。
- LFM2.5-VL 1.6B 和 InternVL3 2B:能正确读出病人姓名,却又把它误判成“不算个人信息”。
作者的结论很直接:“读字”不难,真正难的是“判断”。帖子还提到相关的 Reader 1 组件采用 Apache 2.0 开源许可,且模型都能在 Hugging Face 找到。
所属事件:实测七款开源VLM医学影像脱敏 Qwen3-VL胜出(3 条相关)→
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 果蝇大脑 LLM 权重上架 Hugging Face,兼容 transformers 可直接跑 — ngxson · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11