Glance:4B 开源 VLM 不生成直接读答案,省 85% GPU 成本
multiply_matrix · x · 2026-09-22
Yohei Nakajima(BabyAGI 作者)发布工作论文与工具 glance-vlm:不靠文本生成,而是从冻结的 Qwen3-VL-4B 的 logit 里直接读出结构化视觉判断(yes/no、选项、评级)。
- 识别类任务:在新照片上 yes/no 达 0.939、单选达 0.933,与最强托管模型(0.961/0.937)接近,优于同一模型自己生成答案
- 成本与速度:单张图回答多个问题时 GPU 成本最高省约 85%,比生成 JSON 快约 1/3,精度不变
- 评级类任务:零样本顺序对(99% 图像误差在一个等级内)但精确等级常错(0.669),先展示 16 张无标签参照图可提升到 0.758;此法在图像质量之外不奏效
- 局限:几何判断(相对大小、线条方向)远逊托管模型(0.52 vs 1.00),线性探针显示信息在隐藏态里但读不出来
所有实验预先注册、结果可从仓库复现,可用 pip install glance-vlm。
「研究」频道最新
- 无法回放环境怎么训 RL?从单轨迹学习或成持续学习关键 — rhythmrg · 2026-09-22
- 预训练只是基线?算力重心转向 RL 助模型超越人类水平 — MarvinTBaumann · 2026-09-22
- PyTorch 官方推 TinyTorch:20 模块纯 Python 从零造 ML 框架 — PyTorch · 2026-09-22
- AI 反而不会提升顶尖研究者论文产出,作者解析原因 — kfountou · 2026-09-22
- ICML 2027 或迎 10 万投稿,程序委员会主席该慌了 — CharlotteHase · 2026-09-22
- 实测 2017 年 1080Ti 跑稠密模型反比 RTX 6000 快 2.4 倍 — EAccelerate_42 · 2026-09-22