Ling-3.0-flash-VL 实测:复杂页面 OCR 能保住排版与字段关系

nikola_mr64990 · x · 2026-09-18

开发者用 Ling-3.0-flash-VL 搭了个图文识别小工具,重点测试它处理复杂图片时能否保留版面结构。测试素材覆盖六类难点:数学论文(公式、上下标、希腊字母混排)、IDE 截图(小字号代码与终端输出)、密集表格图表、暗光菜单(低对比度中英混排)、手写笔记、字段密集的发票。

结果显示:数学公式的上下标与符号关系基本保留,小字号代码未大量丢字,表格与发票的字段-数字对应关系也没乱;暗光和手写两类非标准图片中,模型仍能抽出边角的小字和局部信息。

作者认为最有价值的一点不是"认字准",而是模型在"读页面":标题、正文、公式、表格的视觉结构在转文字后得以保留,使论文截图可继续转 Markdown/LaTeX、票据可抽字段、软件截图可入库做知识库,避免了传统 OCR 输出成一长串无结构文本的问题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →