规模化会输在尾部:VLM p90 延迟 209ms,OCR 达 1453ms
spillai · x · 2026-10-02
VLM Run 的实测数据显示,在文档处理管线的规模化场景下,决定成败的是长尾而非均值:
- p90 端到端延迟:VLM 为 209ms(仅比自身 p50 高 9%),而 OCR→文本方案为 1453ms(比自身 p50 高 168%)。
- token 分布:VLM 每页固定消耗约 372 tokens;OCR→文本中位数为 2002 tokens,最差页高达 19159 tokens。
作者结论:批处理容量可以按「每页 372 tokens」来规划,但无法为一个长尾达 19k 的分布做容量规划——OCR 方案的不可预测尾部才是规模化时的真正瓶颈。
「编程与Agent」频道最新
- steipete 踩坑实录:btrfs CoW 利 worktree 却坑坏 sqlite — steipete · 2026-10-02
- Google 开源 Mantis:给编码 Agent 装上安全审查技能包 — udmrzn · 2026-10-02
- Cedana 联手 NVIDIA:单台 8×B200 节点托管整套编码模型组合 — josh_wills · 2026-10-02
- LukeW 预告 Intent Mobile:面向「意图层」的大规模 agent 协调工具 — LukeW · 2026-10-02
- Claude Code v2.1.287 发布:插件可深度修改行为,新增守护插件 — ashwin-ant · 2026-10-02
- LukeW:终端 UI 到聊天客户端,开发工具还没到最终形态 — LukeW · 2026-10-02