7 个本地开源 VLM 争夺第二读者,Qwen3-VL 4B 胜出
MaziyarPanahi · x · 2026-07-22
这条帖子做了一个很实用的本地评测:把 7 个小型开源 VLM 当作“第二读者”,看它们能否识别医疗影像里的身份信息。
- Qwen3-VL 4B:7/7 识别正确,耗时 6.9 秒,且没有误报,被作者选为“第二读者”。
- Gemma 4 E2B:6/7。
- Qwen3-VL 2B:速度最快,但只命中 4/7。
- NVIDIA LocateAnything-3B:框得很准,但不会判断哪些内容属于个人信息。
- LFM2.5-VL 1.6B 和 InternVL3 2B:能正确读出病人姓名,却又把它误判成“不算个人信息”。
作者的结论很直接:“读字”不难,真正难的是“判断”。帖子还提到相关的 Reader 1 组件采用 Apache 2.0 开源许可,且模型都能在 Hugging Face 找到。
所属事件:实测七款开源VLM医学影像脱敏 Qwen3-VL胜出(3 条相关)→
「研究」频道最新
- 蛋白语言模型仅靠单序列也能学到同源寡聚体接触 — anshulkundaje · 2026-07-22
- 研究发现:蛋白质语言模型随规模扩大涌现界面信号 — anshulkundaje · 2026-07-22
- LeCun 的 JEPA 路线迎来一篇世界模型论文 — nikola_mr64990 · 2026-07-22
- MIT 免费开放一批经典 AI 书籍和课程讲义 — ZabihullahAtal · 2026-07-22
- 一条蛋白语言模型研究分享指向序列训练的新发现 — anshulkundaje · 2026-07-22
- 播客探讨单细胞是否具备学习与细胞记忆能力 — arjunrajlab · 2026-07-22