规模化会输在尾部:VLM p90 延迟 209ms,OCR 达 1453ms

spillai · x · 2026-10-02

VLM Run 的实测数据显示,在文档处理管线的规模化场景下,决定成败的是长尾而非均值:

作者结论:批处理容量可以按「每页 372 tokens」来规划,但无法为一个长尾达 19k 的分布做容量规划——OCR 方案的不可预测尾部才是规模化时的真正瓶颈。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →