文档分类实测:VLM 比 OCR 方案节省约 7 倍 token
spillai · x · 2026-10-02
VLM Run 团队用其 TypeSafe 兼容的 SystemOne API 做了一场对比测试:基于 VLM 的文档分类 vs 基于 OCR 文本的分类。
- token 效率:VLM 方案每页固定消耗约 372 tokens,OCR→文本方案中位数约 2002 tokens、最差页达 19159 tokens,整体 VLM 效率高出约 7 倍以上。
- 核心发现是 VLM 在合适的任务上可以既准确又省 token,固定消耗让容量规划变得可预测。
这是一手实测数据,对做文档处理管线的工程团队有直接参考价值。
「编程与Agent」频道最新
- steipete 踩坑实录:btrfs CoW 利 worktree 却坑坏 sqlite — steipete · 2026-10-02
- Google 开源 Mantis:给编码 Agent 装上安全审查技能包 — udmrzn · 2026-10-02
- Cedana 联手 NVIDIA:单台 8×B200 节点托管整套编码模型组合 — josh_wills · 2026-10-02
- LukeW 预告 Intent Mobile:面向「意图层」的大规模 agent 协调工具 — LukeW · 2026-10-02
- LukeW:终端 UI 到聊天客户端,开发工具还没到最终形态 — LukeW · 2026-10-02
- 开发者实测:Astra 规划+Sol 执行最划算,组合方案未必胜过单模型 — kevinkern · 2026-10-02