实测显示开源 VLM 处理第一视角数据已达商用水平
kuaythrone · reddit · 2026-08-31
使用 HFlow 框架基于 Egocentric-10k 数据集评估了最新开源权重 VLM 处理第一视角数据的能力。
评测结果(与 Gemini 2.5 Flash 基准的对比一致性):
- Gemini 2.5 Flash: 91.65%
- GLM 5.3 Flash: 91.00%
- Gemma 4 26B-A4B: 90.87%
- Qwen 3.8 27B: 90.79%
- Inkling Small: 85.21%
核心结论:
- Gemma 4 表现突出,效果与 Gemini 持平,但成本低 19 倍。
- Gemma 和 Qwen 均适合自托管,可实现数据不出域的隐私处理。
- 现代开源 VLM 已具备大规模处理第一视角数据的能力,核心差异点在于成本、吞吐量、输出可靠性和自托管便利性。
「模型」频道最新
- GLM-5.3-Flash 登顶 Agent Arena 榜单第四 — AccBalanced · 2026-09-01
- 智谱 GLM-5.3 Flash 推出 INT4 与 MXFP4 版本 — HaihaoShen · 2026-09-01
- 南贝格 4.2 3B 模型发布 DSpark 权重 — teortaxesTex · 2026-09-01
- Qwen 2.5 72B 本地实测:长上下文吞吐跌一半 — julianharris · 2026-09-01
- DeepSeek 等模型 SWE-bench 得分辟谣:未达 80% — teortaxesTex · 2026-09-01
- Celeris-1 Magnus 登场:称霸 τ³-bench 的 Agent 专用模型 — timshi_ai · 2026-09-01